<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>强化学习 on WorldSense 技术笔记</title><link>https://worldsensetech.com/zh/tags/%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/</link><description>Recent content in 强化学习 on WorldSense 技术笔记</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Fri, 14 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://worldsensetech.com/zh/tags/%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/index.xml" rel="self" type="application/rss+xml"/><item><title>Isaac Lab 入门：面向具身智能的 GPU 加速机器人学习平台</title><link>https://worldsensetech.com/zh/articles/isaac-lab-robot-rl/</link><pubDate>Fri, 14 Aug 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/isaac-lab-robot-rl/</guid><description>&lt;p&gt;过去一周，我们在 MuJoCo + DreamerV3 这条技术路线上深入了很多——从环境搭建到视觉输入训练，再到训练技巧和世界模型的架构演进。&lt;/p&gt;
&lt;p&gt;今天换一个视角，聊聊另一套技术栈：NVIDIA 的 Isaac Lab。&lt;/p&gt;
&lt;p&gt;如果说 MuJoCo 更强调轻量、灵活的动力学研究，适合快速原型开发和算法探索；那么 Isaac Lab 更强调 GPU 加速的大规模机器人训练和 sim-to-real pipeline。两者并不互斥——很多研究团队同时使用 MuJoCo 做算法验证和 Isaac Lab 做规模训练。&lt;/p&gt;
&lt;h2 id="isaac-lab-是什么"&gt;Isaac Lab 是什么？&lt;/h2&gt;
&lt;p&gt;Isaac Lab 是 NVIDIA 基于 Isaac Sim 构建的机器人学习框架，继承自 Isaac Gym 的 GPU 并行仿真思路，提供了更完整的任务抽象和工程结构。它的核心特点是：利用 GPU 加速，实现大规模并行的强化学习训练。&lt;/p&gt;
&lt;p&gt;Isaac Lab 本身不是仿真器，也不是 RL 算法库，而是一个位于 Isaac Sim 之上的任务抽象层：&lt;/p&gt;
&lt;p&gt;&lt;code&gt;Isaac Sim（PhysX + Rendering）→ Isaac Lab（Task Abstraction + RL Integration）→ 训练策略&lt;/code&gt;&lt;/p&gt;
&lt;p&gt;简单来说，Isaac Lab 解决的问题是：如何在短时间内训练出高质量的机器人策略。&lt;/p&gt;
&lt;p&gt;传统的 RL 训练（如我们在 MuJoCo 中用 DreamerV3）通常是单环境或少量并行环境。训练一个策略可能需要几百万步，花费几小时甚至几天。而 Isaac Lab 通过 GPU 并行化，可以同时运行数千个环境，将训练时间从几天缩短到几分钟。&lt;/p&gt;</description></item><item><title>DreamerV3 训练技巧：从踩坑到收敛的实战经验</title><link>https://worldsensetech.com/zh/articles/dreamerv3-training-tips/</link><pubDate>Tue, 11 Aug 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/dreamerv3-training-tips/</guid><description>&lt;p&gt;上一篇文章梳理了世界模型的四条表征路线。今天我们回到 DreamerV3 的实战主题，聊聊训练过程中的那些坑和技巧。本文基于 DreamerV3 commit &lt;code&gt;e3f02248&lt;/code&gt;、JAX + Haiku、MuJoCo + DM Control 的本地实验环境，不同版本的参数名和配置可能有差异。&lt;/p&gt;
&lt;p&gt;DreamerV3 是目前最开源、最成熟的世界模型实现之一。但如果你真的动手训练过，一定知道这个过程并不轻松——环境配置、超参数调优、训练不稳定、收敛慢……各种坑。&lt;/p&gt;
&lt;p&gt;这篇文章总结我在训练 DreamerV3 过程中遇到的常见问题和解决方案，希望能帮你少走弯路。&lt;/p&gt;
&lt;h2 id="环境配置的坑"&gt;环境配置的坑&lt;/h2&gt;
&lt;h3 id="1-mujoco-版本问题"&gt;1. MuJoCo 版本问题&lt;/h3&gt;
&lt;p&gt;DreamerV3 的官方实现基于 JAX + MuJoCo。但 MuJoCo 的版本选择很关键：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;MuJoCo 2.x vs 3.x。官方代码基于 MuJoCo 2.x，但 3.x 版本有性能改进。如果用 3.x，需要修改部分 API 调用。&lt;/li&gt;
&lt;li&gt;mujoco-py vs mujoco。mujoco-py 是旧的 Python 绑定，已经停止维护。建议直接用官方的 mujoco 包。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;建议：优先使用与你当前 DreamerV3 commit 匹配的 MuJoCo 版本，不要一开始就升级整个环境。&lt;/p&gt;
&lt;h3 id="2-jax-的-gpu-配置"&gt;2. JAX 的 GPU 配置&lt;/h3&gt;
&lt;p&gt;JAX 的 GPU 支持需要正确安装 CUDA 和 cuDNN。常见问题：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;CUDA 版本不匹配。JAX 对 CUDA 版本有严格要求，安装前查看官方文档。&lt;/li&gt;
&lt;li&gt;GPU 内存不足。JAX 默认会占用所有 GPU 内存。可以设置 &lt;code&gt;XLA_PYTHON_CLIENT_MEM_FRACTION=0.9&lt;/code&gt; 限制内存使用。如果遇到编译阶段内存峰值过高，也可以设置 &lt;code&gt;XLA_PYTHON_CLIENT_PREALLOCATE=false&lt;/code&gt; 关闭预分配。&lt;/li&gt;
&lt;li&gt;多 GPU 问题。JAX 的多 GPU 支持和 PyTorch 不同，需要特别配置。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;下图是 DreamerV3 在 RTX 5090D 上训练时的实际 GPU 占用情况，显存占用约 25.6GB（32GB 的 78%），GPU 利用率 91%：
![DreamerV3 训练时 GPU 占用情况](/images/nvidia smi.png) 图：RTX 5090D 上 DreamerV3 训练时的 GPU 显存占用（25.6GB / 32GB，利用率 91%）&lt;/p&gt;</description></item><item><title>具身智能、强化学习的前景如何？</title><link>https://worldsensetech.com/zh/articles/embodied-ai-rl-prospects/</link><pubDate>Tue, 04 Aug 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/embodied-ai-rl-prospects/</guid><description>&lt;p&gt;这个问题最近被问得很多。我结合自己观察到的行业情况和招聘市场的变化，说一些实际的。&lt;/p&gt;
&lt;h2 id="先说结论前景好但分化严重"&gt;先说结论：前景好，但分化严重&lt;/h2&gt;
&lt;p&gt;具身智能和强化学习不是&amp;quot;uniformly good&amp;quot;的方向。不同细分领域、不同公司类型、不同岗位的需求差异很大。&lt;/p&gt;
&lt;p&gt;一句话总结：算法岗卷，工程岗缺，应用岗刚起步。&lt;/p&gt;
&lt;h2 id="算法岗卷但天花板高"&gt;算法岗：卷，但天花板高&lt;/h2&gt;
&lt;p&gt;强化学习算法工程师是最热门的方向之一，但竞争也很激烈。&lt;/p&gt;
&lt;p&gt;需求端：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;大厂AI Lab（DeepMind、OpenAI、Meta、字节、腾讯）：持续招聘，但门槛极高，基本要求顶会论文+名校博士&lt;/li&gt;
&lt;li&gt;人形机器人公司（宇树、智元、傅利叶等）：2024-2025年大量扩招，但2026年开始收紧，更看重实际落地能力&lt;/li&gt;
&lt;li&gt;自动驾驶公司（Waymo、小鹏、华为）：决策规划模块需要RL背景，需求稳定&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;薪资范围（2026年，国内，仅供参考）：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;应届博士：约40-80万/年（大厂SP offer可达100万+，但名额很少）&lt;/li&gt;
&lt;li&gt;3-5年经验：约60-120万/年（因公司、地区、个人能力差异较大）&lt;/li&gt;
&lt;li&gt;资深/专家：150万+（这类岗位非常稀缺）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;现实问题：算法岗的HC（headcount）在减少。2024年人形机器人热潮时大量招聘，2025-2026年很多公司发现技术落地比预期慢，开始优化团队。纯算法、没有工程能力的人风险最大。&lt;/p&gt;
&lt;h2 id="工程岗缺人但要求复合背景"&gt;工程岗：缺人，但要求复合背景&lt;/h2&gt;
&lt;p&gt;这是我觉得被低估的方向。&lt;/p&gt;
&lt;p&gt;具身智能不只是算法问题，更是工程问题。把模型部署到真实机器人上，需要解决：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;实时控制：策略推理延迟要控制在10ms以内&lt;/li&gt;
&lt;li&gt;硬件集成：传感器标定、执行器驱动、通信协议&lt;/li&gt;
&lt;li&gt;系统优化：CUDA加速、模型压缩、边缘部署&lt;/li&gt;
&lt;li&gt;仿真平台：搭建和维护大规模并行仿真环境&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;能做这些事的人，目前市场上很缺。而且这类岗位对学历的要求相对宽松——本科+实战经验就可以，不一定需要博士。&lt;/p&gt;
&lt;p&gt;薪资范围（仅供参考）：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;3-5年经验：约50-90万/年（因公司、地区、个人能力差异较大）&lt;/li&gt;
&lt;li&gt;资深工程师：约80-150万/年（高级岗位数量有限）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;不比算法岗低多少，但竞争小很多。&lt;/p&gt;
&lt;h2 id="应用岗刚起步机会最大"&gt;应用岗：刚起步，机会最大&lt;/h2&gt;
&lt;p&gt;这是我最看好的方向。&lt;/p&gt;
&lt;p&gt;具身智能的技术已经过了&amp;quot;能不能做&amp;quot;的阶段，进入&amp;quot;怎么用&amp;quot;的阶段。工厂里需要把AI能力集成到现有产线，物流公司需要机器人分拣，医院需要手术辅助——这些场景不需要你发明新算法，需要你把现有技术应用到具体问题。&lt;/p&gt;
&lt;p&gt;典型岗位：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;机器人应用工程师：负责具体场景的任务适配和部署&lt;/li&gt;
&lt;li&gt;Sim-to-Real工程师：把仿真训练的策略迁移到真实机器人&lt;/li&gt;
&lt;li&gt;技术方案工程师：对接客户需求，设计技术解决方案&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这类岗位的需求正在快速增长，但目前供给不足。因为传统机器人工程师不懂AI，AI工程师不懂机器人，两者都懂的人很少。&lt;/p&gt;
&lt;p&gt;薪资范围（仅供参考）：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;3-5年经验：约40-70万/年（因公司、地区、个人能力差异较大）&lt;/li&gt;
&lt;li&gt;资深/管理岗：约70-120万/年（这类岗位相对稀缺）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;起薪可能不如算法岗，但增长空间大，而且离业务近，不容易被优化。&lt;/p&gt;
&lt;h2 id="几个趋势判断"&gt;几个趋势判断&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;纯算法岗会继续卷，工程和应用岗会升值。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;随着基础模型（大语言模型、基础世界模型）越来越强，&amp;ldquo;调参侠&amp;quot;的价值在下降。能把模型落地的人价值在上升。&lt;/p&gt;
&lt;ol start="2"&gt;
&lt;li&gt;跨界人才最吃香。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;懂AI + 懂机器人 + 懂行业（制造、物流、医疗）的复合型人才，未来3-5年都会很抢手。&lt;/p&gt;
&lt;ol start="3"&gt;
&lt;li&gt;创业机会在应用层。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;基础模型是大厂的游戏，但应用层有大量细分场景还没被覆盖。比如&amp;quot;用世界模型做工厂机器人快速任务适配&amp;rdquo;，这种方向大厂看不上，但市场需求真实存在。&lt;/p&gt;
&lt;ol start="4"&gt;
&lt;li&gt;地域分化明显。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;北京、上海、深圳、杭州集中了80%以上的岗位。其他城市的机会很少，除非是当地有机器人产业集群（比如东莞、苏州）。&lt;/p&gt;
&lt;h2 id="给不同背景的人的建议"&gt;给不同背景的人的建议&lt;/h2&gt;
&lt;p&gt;在校学生：如果有机会读博，读博。算法岗的门槛只会越来越高。但博士期间一定要做有工程价值的工作，不要纯理论。&lt;/p&gt;
&lt;p&gt;转行者：不要直接冲算法岗，竞争太激烈。从工程岗或应用岗切入，积累实战经验后再往算法方向转。&lt;/p&gt;
&lt;p&gt;传统机器人工程师：学PyTorch、学RL基础、学仿真工具（MuJoCo、Isaac Sim）。你已有的机器人知识是优势，补上AI这块就很有竞争力。&lt;/p&gt;
&lt;p&gt;纯软件工程师：学机器人学基础、学控制理论、了解硬件。你的编程能力是优势，补上物理世界这块。&lt;/p&gt;
&lt;h2 id="最后说一点"&gt;最后说一点&lt;/h2&gt;
&lt;p&gt;具身智能和强化学习的前景是好的，但这个&amp;quot;好&amp;quot;不是均匀的。它属于那些愿意深入理解问题、能动手解决实际问题的人，不属于只想追风口的人。&lt;/p&gt;
&lt;p&gt;我自己在做的方向是世界模型 + Sim-to-Real，属于工程和应用之间的交叉地带。没有大厂的资源，也没有学术界的背景，但通过持续输出内容、积累实战经验，慢慢建立自己的影响力。&lt;/p&gt;
&lt;p&gt;这条路不快，但走通了就很稳。&lt;/p&gt;</description></item><item><title>强化学习应该怎么入门？</title><link>https://worldsensetech.com/zh/articles/reinforcement-learning-how-to-start/</link><pubDate>Mon, 03 Aug 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/reinforcement-learning-how-to-start/</guid><description>&lt;p&gt;这个问题我很有感触。我自己就是从传统自动化转到强化学习方向的，中间踩了不少坑。说说我觉得最有效的路径。&lt;/p&gt;
&lt;h2 id="先搞清楚你要学强化学习做什么"&gt;先搞清楚：你要学强化学习做什么&lt;/h2&gt;
&lt;p&gt;强化学习的应用方向差异很大，学习路径也不同：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;玩游戏/仿真：Atari游戏、MuJoCo机器人仿真——入门最友好，资源最多&lt;/li&gt;
&lt;li&gt;机器人控制：机械臂、四足机器人、人形机器人——需要结合仿真和Sim-to-Real&lt;/li&gt;
&lt;li&gt;推荐系统/广告：互联网公司的主要应用场景——偏工程，数学要求相对低&lt;/li&gt;
&lt;li&gt;自动驾驶：决策规划模块——需要结合传统控制理论&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;先确定方向，再选择学习路径，效率会高很多。下面的建议以&amp;quot;机器人控制&amp;quot;为主线，因为这是我最熟悉的方向，也是目前最有前景的方向之一。&lt;/p&gt;
&lt;h2 id="第一阶段打基础1-2个月"&gt;第一阶段：打基础（1-2个月）&lt;/h2&gt;
&lt;h3 id="数学基础"&gt;数学基础&lt;/h3&gt;
&lt;p&gt;不需要博士级别的数学，但以下必须掌握：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;线性代数：矩阵运算、特征值分解、SVD——神经网络的基础&lt;/li&gt;
&lt;li&gt;概率论：贝叶斯定理、高斯分布、采样——RL的核心是概率决策&lt;/li&gt;
&lt;li&gt;微积分：梯度、链式法则、优化——理解反向传播和策略梯度&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;推荐资源：3Blue1Brown的线性代数和微积分视频（B站有），直观易懂。&lt;/p&gt;
&lt;h3 id="深度学习基础"&gt;深度学习基础&lt;/h3&gt;
&lt;p&gt;不需要从头实现神经网络，但要理解：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;CNN、RNN、Transformer的基本原理和适用场景&lt;/li&gt;
&lt;li&gt;能用PyTorch搭建简单网络并训练&lt;/li&gt;
&lt;li&gt;理解过拟合、正则化、学习率调度等训练技巧&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;推荐资源：李宏毅的机器学习课程（B站免费），讲得非常清楚。&lt;/p&gt;
&lt;h3 id="强化学习核心概念"&gt;强化学习核心概念&lt;/h3&gt;
&lt;p&gt;必须理解的概念（按顺序）：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;MDP（马尔可夫决策过程）：状态、动作、奖励、转移概率&lt;/li&gt;
&lt;li&gt;值函数和Q函数：评估&amp;quot;这个状态/动作有多好&amp;quot;&lt;/li&gt;
&lt;li&gt;策略梯度：直接优化策略参数&lt;/li&gt;
&lt;li&gt;Actor-Critic：结合值函数和策略梯度的优势&lt;/li&gt;
&lt;li&gt;探索与利用的权衡：ε-greedy、UCB、熵正则化&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;推荐资源：David Silver的强化学习课程（YouTube/B站），经典中的经典。&lt;/p&gt;
&lt;h2 id="第二阶段动手实践1-2个月"&gt;第二阶段：动手实践（1-2个月）&lt;/h2&gt;
&lt;p&gt;这是最重要的阶段。读10篇论文不如自己跑通一个项目。&lt;/p&gt;
&lt;h3 id="第一个项目cartpole"&gt;第一个项目：CartPole&lt;/h3&gt;
&lt;p&gt;用DQN或PPO在CartPole（倒立摆）上训练一个策略。这个任务简单，几分钟就能跑完，但能帮你理解整个RL训练流程：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;环境交互：agent执行动作，环境返回新状态和奖励&lt;/li&gt;
&lt;li&gt;经验收集：把交互数据存储到replay buffer&lt;/li&gt;
&lt;li&gt;策略更新：从buffer采样，计算损失，更新网络&lt;/li&gt;
&lt;li&gt;评估：定期测试策略性能，画训练曲线&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;推荐框架：Stable-Baselines3（封装好了主流算法，接口简洁）&lt;/p&gt;
&lt;h3 id="第二个项目mujoco机器人"&gt;第二个项目：MuJoCo机器人&lt;/h3&gt;
&lt;p&gt;选一个MuJoCo环境（推荐HalfCheetah或Ant），用PPO或SAC训练。&lt;/p&gt;
&lt;p&gt;这个阶段你会遇到真实的问题：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;训练不稳定，奖励曲线震荡——学习率、batch size、网络结构都可能需要调&lt;/li&gt;
&lt;li&gt;策略收敛到局部最优——需要调整探索策略&lt;/li&gt;
&lt;li&gt;训练太慢——需要理解并行化、向量化环境&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这些&amp;quot;坑&amp;quot;才是真正学到的东西。&lt;/p&gt;
&lt;h2 id="第三阶段深入一个方向2-3个月"&gt;第三阶段：深入一个方向（2-3个月）&lt;/h2&gt;
&lt;p&gt;基础RL掌握后，选择一个方向深入：&lt;/p&gt;
&lt;h3 id="方向a世界模型model-based-rl"&gt;方向A：世界模型（Model-Based RL）&lt;/h3&gt;
&lt;p&gt;学习DreamerV3、TD-MPC2等算法。核心思想是先学习环境模型，再在模型中训练策略。样本效率高，适合机器人场景。&lt;/p&gt;
&lt;p&gt;入门路径：读DreamerV3论文 → 跑通官方代码 → 在自己的MuJoCo任务上实验&lt;/p&gt;
&lt;h3 id="方向b离线强化学习offline-rl"&gt;方向B：离线强化学习（Offline RL）&lt;/h3&gt;
&lt;p&gt;从固定数据集中学习策略，不需要在线交互。适合真实机器人场景（数据收集成本高）。&lt;/p&gt;
&lt;p&gt;入门路径：读CQL或IQL论文 → 在D4RL数据集上实验&lt;/p&gt;
&lt;h3 id="方向c多智能体强化学习marl"&gt;方向C：多智能体强化学习（MARL）&lt;/h3&gt;
&lt;p&gt;多个智能体协作或竞争。适合无人机编队、交通调度等场景。&lt;/p&gt;
&lt;p&gt;入门路径：读MAPPO或QMIX论文 → 在StarCraft II或Google Research Football上实验&lt;/p&gt;</description></item></channel></rss>