<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>具身智能 on WorldSense 技术笔记</title><link>https://worldsensetech.com/zh/tags/%E5%85%B7%E8%BA%AB%E6%99%BA%E8%83%BD/</link><description>Recent content in 具身智能 on WorldSense 技术笔记</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Sat, 15 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://worldsensetech.com/zh/tags/%E5%85%B7%E8%BA%AB%E6%99%BA%E8%83%BD/index.xml" rel="self" type="application/rss+xml"/><item><title>Isaac Lab 安装避坑指南：从零到跑通全流程</title><link>https://worldsensetech.com/zh/articles/isaac-lab-install-guide/</link><pubDate>Sat, 15 Aug 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/isaac-lab-install-guide/</guid><description>&lt;p&gt;上一篇介绍了 Isaac Lab 是什么、能做什么。但如果你真的动手装过，会发现从&amp;quot;克隆代码&amp;quot;到&amp;quot;跑通 example&amp;quot;之间，隔着不少坑。&lt;/p&gt;
&lt;p&gt;这篇文章记录我在 AutoDL 云 GPU 服务器（RTX 5090D/32GB）上安装 Isaac Lab 的完整过程。每一个报错都是真实遇到的，每一个解决方案都是实际验证过的。希望能帮你省掉几个小时的排查时间。&lt;/p&gt;
&lt;h2 id="为什么-isaac-lab-这么难装"&gt;为什么 Isaac Lab 这么难装？&lt;/h2&gt;
&lt;p&gt;Isaac Lab 的安装复杂度主要来自三个方面：&lt;/p&gt;
&lt;p&gt;依赖链长。Isaac Lab 依赖 Isaac Sim，Isaac Sim 依赖 NVIDIA 驱动、CUDA、特定版本的 PyTorch，而 PyTorch 又依赖特定版本的 numpy、triton 等。任何一环版本不对，都会报错。&lt;/p&gt;
&lt;p&gt;Python 版本要求高。Isaac Lab 要求 Python ≥ 3.12，而很多服务器和云 GPU 平台的基础镜像还在用 Python 3.10 或 3.11。版本不满足会直接安装失败。&lt;/p&gt;
&lt;p&gt;包体积大。PyTorch + CUDA 的 whl 文件超过 2GB，numpy 也有几十 MB。在国内网络环境下，从 PyPI 下载经常中断，而且 pip 的断点续传并不总是可靠。&lt;/p&gt;
&lt;h2 id="环境要求"&gt;环境要求&lt;/h2&gt;
&lt;p&gt;在开始安装之前，确认你的环境满足以下条件：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;GPU。NVIDIA RTX 级别以上 GPU（推荐 RTX 4090 或更高）&lt;/li&gt;
&lt;li&gt;系统。Ubuntu 22.04（推荐）或 Windows&lt;/li&gt;
&lt;li&gt;Python。3.12 或更高版本（这是硬要求，3.11 也不行）&lt;/li&gt;
&lt;li&gt;驱动。NVIDIA 驱动 525+ 和 CUDA 12+&lt;/li&gt;
&lt;li&gt;内存。16GB+（推荐 32GB）&lt;/li&gt;
&lt;li&gt;磁盘。至少 50GB 可用空间（Isaac Sim 本身体积较大）&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="第一步解决-python-版本问题"&gt;第一步：解决 Python 版本问题&lt;/h2&gt;
&lt;p&gt;这是最容易踩的第一个坑。很多服务器默认的 Python 版本是 3.10 或 3.11，直接跑 &lt;code&gt;./isaaclab.sh --install&lt;/code&gt; 会报：&lt;/p&gt;</description></item><item><title>机器人数据为什么比大模型数据更难？具身智能的数据闭环挑战</title><link>https://worldsensetech.com/zh/articles/robot-data-challenge/</link><pubDate>Thu, 13 Aug 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/robot-data-challenge/</guid><description>&lt;p&gt;大语言模型的发展证明了，大规模、多样化的数据可以显著提升模型能力。但数据规模只是其中一个因素，Transformer 架构、预训练目标、scaling law 以及 RLHF 等后训练方法共同作用，才成就了今天的 LLM。&lt;/p&gt;
&lt;p&gt;但如果你做过机器人 AI，一定知道：机器人领域的数据，比语言数据难得多。&lt;/p&gt;
&lt;p&gt;为什么？机器人数据到底难在哪里？有没有解决方案？&lt;/p&gt;
&lt;p&gt;这篇文章从数据的角度，聊聊具身智能的核心挑战。&lt;/p&gt;
&lt;h2 id="机器人数据的独特挑战"&gt;机器人数据的独特挑战&lt;/h2&gt;
&lt;p&gt;从数据形式上看，文本通常可以被离散化为 token 序列进行处理，而机器人数据天然包含连续控制、多传感器、多时间尺度和物理交互。机器人一次交互涉及 RGB/RGB-D 图像、本体感知（关节状态）、力/力矩、动作轨迹、语言指令、环境状态等多模态信息，具有高维、时序、物理约束和交互依赖等特征。&lt;/p&gt;
&lt;h3 id="1-采集成本高"&gt;1. 采集成本高&lt;/h3&gt;
&lt;p&gt;语言数据可以从互联网上爬取，成本几乎为零。但机器人数据需要真实机器人执行任务，同时记录传感器数据。&lt;/p&gt;
&lt;p&gt;高质量机器人数据采集通常需要昂贵硬件、人工遥操作和大量工程维护。一个复杂任务的数据规模扩展成本远高于互联网数据——不仅需要硬件投入，还需要数据清洗、标注和反复验证。&lt;/p&gt;
&lt;h3 id="2-标注困难"&gt;2. 标注困难&lt;/h3&gt;
&lt;p&gt;语言数据的标注相对简单——分类、实体识别、情感标注，都有明确的标签体系。但机器人数据的标注复杂得多：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;动作标注。机器人动作是连续的高维序列，如何定义&amp;quot;好&amp;quot;的动作？以抓取为例，动作可以是关节轨迹 &lt;code&gt;[q1(t), q2(t)...q7(t)]&lt;/code&gt;、夹爪力、速度、接触状态等。同一个任务存在大量有效解——比如&amp;quot;打开抽屉&amp;quot;可以从左侧拉、从右侧拉、两指抓、三指抓、快速拉或慢速拉——因此机器人数据标注更接近学习一个条件分布 &lt;code&gt;p(action | observation, task)&lt;/code&gt;，而非简单的 &lt;code&gt;f(x) = label&lt;/code&gt; 式的标签预测。&lt;/li&gt;
&lt;li&gt;奖励标注。很多任务没有明确的奖励信号，需要人工设计或从演示中学习。&lt;/li&gt;
&lt;li&gt;场景标注。3D 场景理解、物体位姿、接触点等标注，需要专业工具和知识。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="3-分布狭窄"&gt;3. 分布狭窄&lt;/h3&gt;
&lt;p&gt;语言数据覆盖了各种主题、风格、语言。但机器人数据通常只覆盖：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;特定的机器人硬件&lt;/li&gt;
&lt;li&gt;特定的任务类型&lt;/li&gt;
&lt;li&gt;特定的场景环境&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这导致机器人模型的泛化能力远不如语言模型。在一个机器人上训练的策略，换个机器人可能就失效了。这里还存在一个更深层的问题——embodiment gap：不仅来自机器人形态差异（如 7-DoF 的 Franka 和人形机器人的手），也来自传感器配置（RGB camera vs tactile sensor vs force-torque）、控制频率（20Hz vs 200Hz）和动作空间的差异。这也是 Open X-Embodiment 等跨机器人数据集的重要性所在——它们探索如何利用跨机器人数据提升泛化能力。&lt;/p&gt;
&lt;h3 id="4-安全性要求"&gt;4. 安全性要求&lt;/h3&gt;
&lt;p&gt;机器人模型出错会直接作用于物理世界，因此安全验证要求更加严格。这意味着：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;训练数据需要过滤危险行为&lt;/li&gt;
&lt;li&gt;部署前需要严格的安全验证&lt;/li&gt;
&lt;li&gt;需要人工监督和干预机制&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这些安全要求，增加了数据收集和模型训练的复杂度。&lt;/p&gt;
&lt;h2 id="当前的数据获取与扩展方案"&gt;当前的数据获取与扩展方案&lt;/h2&gt;
&lt;p&gt;面对这些挑战，业界有几种主要的应对策略：&lt;/p&gt;</description></item><item><title>机器人训练为什么需要虚拟世界？MuJoCo 和 Isaac Sim 全面对比</title><link>https://worldsensetech.com/zh/articles/mujoco-vs-isaac-sim/</link><pubDate>Sun, 09 Aug 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/mujoco-vs-isaac-sim/</guid><description>&lt;p&gt;上一篇我们聊了域随机化的工程实现。但不管是域随机化、策略训练、还是 Sim-to-Real 验证，都离不开一个基础工具：仿真环境。&lt;/p&gt;
&lt;p&gt;为什么仿真对具身智能这么重要？原因很直接：真实世界的机器人数据太贵、太慢、太危险。你不可能让一台真实机器人每天尝试几百万次抓取来学习——硬件磨损、时间成本、安全风险都不允许。仿真环境提供了一个可无限重试、可完全控制变量的训练场所，是当前具身智能规模化训练的核心基础设施。&lt;/p&gt;
&lt;p&gt;目前这个领域最主流的两个选择是 MuJoCo 和 NVIDIA Isaac Sim。这篇文章从五个维度做系统对比：物理引擎、渲染能力、RL 训练效率、生态工具、适用场景，帮你根据项目需求做出选择。&lt;/p&gt;
&lt;h2 id="物理引擎对比"&gt;物理引擎对比&lt;/h2&gt;
&lt;h3 id="mujoco"&gt;MuJoCo&lt;/h3&gt;
&lt;p&gt;MuJoCo（Multi-Joint dynamics with Contact）由 Emo Todorov 团队开发，2021年被 DeepMind 收购后开源。它的核心优势是：&lt;/p&gt;
&lt;p&gt;接触动力学精度高。MuJoCo 使用约束-based 的接触模型，能准确模拟摩擦、碰撞、关节限位等。对于机器人操作任务（抓取、推、插装），接触精度至关重要。&lt;/p&gt;
&lt;p&gt;计算速度快。MuJoCo 的求解器高度优化，单线程就能跑很快。对于需要大量 rollouts 的强化学习训练，速度是硬指标。&lt;/p&gt;
&lt;p&gt;数值稳定性好。MuJoCo 的积分器和约束求解器经过多年打磨，不容易出现仿真崩溃（比如物体穿模、关节爆炸）。&lt;/p&gt;
&lt;p&gt;渲染能力近年来有所增强，但设计重点不同。MuJoCo 近年来增强了渲染能力，支持相机观测、深度图等视觉输入，DM Control pixels benchmark、RoboSuite 图像任务、Dreamer 系列视觉控制实验都基于 MuJoCo 运行。但它的设计重点仍然是高效动力学模拟和控制研究，而不是大规模照片级合成数据生成。如果需要照片级逼真的图像输入，Isaac Sim 仍有明显优势。&lt;/p&gt;
&lt;h3 id="isaac-sim"&gt;Isaac Sim&lt;/h3&gt;
&lt;p&gt;Isaac Sim 是 NVIDIA 基于 Omniverse 平台开发的机器人仿真器。它的核心优势是：&lt;/p&gt;
&lt;p&gt;GPU 加速物理。Isaac Sim 基于 NVIDIA PhysX 5，并通过 GPU 加速和 Isaac Lab 的并行环境管理支持大规模机器人学习训练。这种架构源自 Isaac Gym 的 GPU pipeline，在 Isaac Lab 的 vectorized environments 中得到延续。&lt;/p&gt;</description></item><item><title>具身智能、强化学习的前景如何？</title><link>https://worldsensetech.com/zh/articles/embodied-ai-rl-prospects/</link><pubDate>Tue, 04 Aug 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/embodied-ai-rl-prospects/</guid><description>&lt;p&gt;这个问题最近被问得很多。我结合自己观察到的行业情况和招聘市场的变化，说一些实际的。&lt;/p&gt;
&lt;h2 id="先说结论前景好但分化严重"&gt;先说结论：前景好，但分化严重&lt;/h2&gt;
&lt;p&gt;具身智能和强化学习不是&amp;quot;uniformly good&amp;quot;的方向。不同细分领域、不同公司类型、不同岗位的需求差异很大。&lt;/p&gt;
&lt;p&gt;一句话总结：算法岗卷，工程岗缺，应用岗刚起步。&lt;/p&gt;
&lt;h2 id="算法岗卷但天花板高"&gt;算法岗：卷，但天花板高&lt;/h2&gt;
&lt;p&gt;强化学习算法工程师是最热门的方向之一，但竞争也很激烈。&lt;/p&gt;
&lt;p&gt;需求端：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;大厂AI Lab（DeepMind、OpenAI、Meta、字节、腾讯）：持续招聘，但门槛极高，基本要求顶会论文+名校博士&lt;/li&gt;
&lt;li&gt;人形机器人公司（宇树、智元、傅利叶等）：2024-2025年大量扩招，但2026年开始收紧，更看重实际落地能力&lt;/li&gt;
&lt;li&gt;自动驾驶公司（Waymo、小鹏、华为）：决策规划模块需要RL背景，需求稳定&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;薪资范围（2026年，国内，仅供参考）：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;应届博士：约40-80万/年（大厂SP offer可达100万+，但名额很少）&lt;/li&gt;
&lt;li&gt;3-5年经验：约60-120万/年（因公司、地区、个人能力差异较大）&lt;/li&gt;
&lt;li&gt;资深/专家：150万+（这类岗位非常稀缺）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;现实问题：算法岗的HC（headcount）在减少。2024年人形机器人热潮时大量招聘，2025-2026年很多公司发现技术落地比预期慢，开始优化团队。纯算法、没有工程能力的人风险最大。&lt;/p&gt;
&lt;h2 id="工程岗缺人但要求复合背景"&gt;工程岗：缺人，但要求复合背景&lt;/h2&gt;
&lt;p&gt;这是我觉得被低估的方向。&lt;/p&gt;
&lt;p&gt;具身智能不只是算法问题，更是工程问题。把模型部署到真实机器人上，需要解决：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;实时控制：策略推理延迟要控制在10ms以内&lt;/li&gt;
&lt;li&gt;硬件集成：传感器标定、执行器驱动、通信协议&lt;/li&gt;
&lt;li&gt;系统优化：CUDA加速、模型压缩、边缘部署&lt;/li&gt;
&lt;li&gt;仿真平台：搭建和维护大规模并行仿真环境&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;能做这些事的人，目前市场上很缺。而且这类岗位对学历的要求相对宽松——本科+实战经验就可以，不一定需要博士。&lt;/p&gt;
&lt;p&gt;薪资范围（仅供参考）：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;3-5年经验：约50-90万/年（因公司、地区、个人能力差异较大）&lt;/li&gt;
&lt;li&gt;资深工程师：约80-150万/年（高级岗位数量有限）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;不比算法岗低多少，但竞争小很多。&lt;/p&gt;
&lt;h2 id="应用岗刚起步机会最大"&gt;应用岗：刚起步，机会最大&lt;/h2&gt;
&lt;p&gt;这是我最看好的方向。&lt;/p&gt;
&lt;p&gt;具身智能的技术已经过了&amp;quot;能不能做&amp;quot;的阶段，进入&amp;quot;怎么用&amp;quot;的阶段。工厂里需要把AI能力集成到现有产线，物流公司需要机器人分拣，医院需要手术辅助——这些场景不需要你发明新算法，需要你把现有技术应用到具体问题。&lt;/p&gt;
&lt;p&gt;典型岗位：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;机器人应用工程师：负责具体场景的任务适配和部署&lt;/li&gt;
&lt;li&gt;Sim-to-Real工程师：把仿真训练的策略迁移到真实机器人&lt;/li&gt;
&lt;li&gt;技术方案工程师：对接客户需求，设计技术解决方案&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这类岗位的需求正在快速增长，但目前供给不足。因为传统机器人工程师不懂AI，AI工程师不懂机器人，两者都懂的人很少。&lt;/p&gt;
&lt;p&gt;薪资范围（仅供参考）：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;3-5年经验：约40-70万/年（因公司、地区、个人能力差异较大）&lt;/li&gt;
&lt;li&gt;资深/管理岗：约70-120万/年（这类岗位相对稀缺）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;起薪可能不如算法岗，但增长空间大，而且离业务近，不容易被优化。&lt;/p&gt;
&lt;h2 id="几个趋势判断"&gt;几个趋势判断&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;纯算法岗会继续卷，工程和应用岗会升值。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;随着基础模型（大语言模型、基础世界模型）越来越强，&amp;ldquo;调参侠&amp;quot;的价值在下降。能把模型落地的人价值在上升。&lt;/p&gt;
&lt;ol start="2"&gt;
&lt;li&gt;跨界人才最吃香。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;懂AI + 懂机器人 + 懂行业（制造、物流、医疗）的复合型人才，未来3-5年都会很抢手。&lt;/p&gt;
&lt;ol start="3"&gt;
&lt;li&gt;创业机会在应用层。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;基础模型是大厂的游戏，但应用层有大量细分场景还没被覆盖。比如&amp;quot;用世界模型做工厂机器人快速任务适配&amp;rdquo;，这种方向大厂看不上，但市场需求真实存在。&lt;/p&gt;
&lt;ol start="4"&gt;
&lt;li&gt;地域分化明显。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;北京、上海、深圳、杭州集中了80%以上的岗位。其他城市的机会很少，除非是当地有机器人产业集群（比如东莞、苏州）。&lt;/p&gt;
&lt;h2 id="给不同背景的人的建议"&gt;给不同背景的人的建议&lt;/h2&gt;
&lt;p&gt;在校学生：如果有机会读博，读博。算法岗的门槛只会越来越高。但博士期间一定要做有工程价值的工作，不要纯理论。&lt;/p&gt;
&lt;p&gt;转行者：不要直接冲算法岗，竞争太激烈。从工程岗或应用岗切入，积累实战经验后再往算法方向转。&lt;/p&gt;
&lt;p&gt;传统机器人工程师：学PyTorch、学RL基础、学仿真工具（MuJoCo、Isaac Sim）。你已有的机器人知识是优势，补上AI这块就很有竞争力。&lt;/p&gt;
&lt;p&gt;纯软件工程师：学机器人学基础、学控制理论、了解硬件。你的编程能力是优势，补上物理世界这块。&lt;/p&gt;
&lt;h2 id="最后说一点"&gt;最后说一点&lt;/h2&gt;
&lt;p&gt;具身智能和强化学习的前景是好的，但这个&amp;quot;好&amp;quot;不是均匀的。它属于那些愿意深入理解问题、能动手解决实际问题的人，不属于只想追风口的人。&lt;/p&gt;
&lt;p&gt;我自己在做的方向是世界模型 + Sim-to-Real，属于工程和应用之间的交叉地带。没有大厂的资源，也没有学术界的背景，但通过持续输出内容、积累实战经验，慢慢建立自己的影响力。&lt;/p&gt;
&lt;p&gt;这条路不快，但走通了就很稳。&lt;/p&gt;</description></item><item><title>你认为具身智能领域在2026年会有什么突破性进展？</title><link>https://worldsensetech.com/zh/articles/embodied-ai-2026-breakthrough/</link><pubDate>Mon, 03 Aug 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/embodied-ai-2026-breakthrough/</guid><description>&lt;p&gt;具身智能（Embodied AI）在2025年已经明显加速了。人形机器人公司扎堆融资，大模型厂商纷纷布局机器人方向，各国政府也把具身智能列为战略重点。站在2026年的节点上，我觉得有几个方向会出现实质性突破。&lt;/p&gt;
&lt;h2 id="突破一世界模型从能想象到能决策"&gt;突破一：世界模型从&amp;quot;能想象&amp;quot;到&amp;quot;能决策&amp;quot;&lt;/h2&gt;
&lt;p&gt;2023-2024年，DreamerV3证明了世界模型可以在仿真中高效训练策略。但那时候的世界模型更像一个&amp;quot;环境模拟器&amp;quot;——能预测下一步会怎样，但和实际决策之间还隔着一层。&lt;/p&gt;
&lt;p&gt;2026年，我看到一个明显趋势：世界模型开始直接和决策系统打通。不再是&amp;quot;先建模、再训练策略&amp;quot;的两阶段流程，而是端到端的&amp;quot;建模即决策&amp;quot;。这意味着机器人可以在想象空间中直接完成从感知到规划到控制的全流程，不需要额外的策略网络。&lt;/p&gt;
&lt;p&gt;这个突破的意义在于：大幅缩短从&amp;quot;理解世界&amp;quot;到&amp;quot;采取行动&amp;quot;的链路，让机器人的反应速度接近人类水平。&lt;/p&gt;
&lt;h2 id="突破二sim-to-real迁移出现工程化方案"&gt;突破二：Sim-to-Real迁移出现工程化方案&lt;/h2&gt;
&lt;p&gt;这是我最期待的突破。过去八年，Sim-to-Real一直是世界模型落地的最大瓶颈。仿真里训练的策略，到真实世界性能打对折。&lt;/p&gt;
&lt;p&gt;2026年，几个技术路线开始 converge（汇合）：&lt;/p&gt;
&lt;p&gt;系统辨识自动化。不再需要工程师手动调参来匹配仿真和真实世界的物理参数，模型可以自动从少量真实数据中学习未建模的动态。&lt;/p&gt;
&lt;p&gt;渐进式信任迁移。策略不是一次性从仿真跳到真实世界，而是通过&amp;quot;仿真→混合环境→真实世界&amp;quot;的渐进过程，每一步都有安全约束保证不会出大问题。&lt;/p&gt;
&lt;p&gt;在线模型适配。部署到真实世界后，模型能持续从真实数据中学习，不断修正自己的预测偏差。&lt;/p&gt;
&lt;p&gt;这几个方向结合起来，2026年应该能看到第一批*&amp;ldquo;仿真训练、真实部署、性能不打折&amp;quot;的工业案例。不是实验室demo，是真正能在工厂里跑的。&lt;/p&gt;
&lt;h2 id="突破三多模态感知与物理理解的融合"&gt;突破三：多模态感知与物理理解的融合&lt;/h2&gt;
&lt;p&gt;之前的世界模型主要处理视觉信息（相机图像）。但真实世界的机器人需要融合多种感知——视觉、触觉、力觉、甚至听觉。&lt;/p&gt;
&lt;p&gt;2026年，多模态世界模型开始成熟。机器人不仅能&amp;quot;看到&amp;quot;物体，还能通过触觉反馈理解物体的材质、重量、摩擦力。这种多模态的物理理解，是灵巧操作（比如拧瓶盖、系鞋带、翻书页）的关键前提。&lt;/p&gt;
&lt;p&gt;我特别关注的是触觉传感器的进步。新一代高分辨率触觉传感器（比如GelSight的后续产品）能提供密集的接触力分布信息，让世界模型的物理预测从&amp;quot;大概合理&amp;quot;变成&amp;quot;精确可信&amp;rdquo;。&lt;/p&gt;
&lt;h2 id="突破四基础世界模型的雏形出现"&gt;突破四：基础世界模型的雏形出现&lt;/h2&gt;
&lt;p&gt;大语言模型的成功证明了一个规律：当模型足够大、数据足够多时，会涌现出意想不到的能力。世界模型领域也在走这条路。&lt;/p&gt;
&lt;p&gt;2026年，可能会出现第一批&amp;quot;基础世界模型&amp;quot;的雏形——不是针对某个特定任务训练的，而是在大规模多任务数据上预训练的通用世界模型。这种模型可以通过少量微调适配到不同的机器人任务上，就像GPT可以通过prompt适配到不同文本任务一样。&lt;/p&gt;
&lt;p&gt;当然，离真正的&amp;quot;通用世界模型&amp;quot;还很远。计算成本、数据规模、架构设计都还有大量问题。但方向是明确的，2026年应该能看到有价值的早期成果。&lt;/p&gt;
&lt;h2 id="一个需要冷静的地方"&gt;一个需要冷静的地方&lt;/h2&gt;
&lt;p&gt;说了这么多突破，也要泼一点冷水。&lt;/p&gt;
&lt;p&gt;具身智能的突破和NLP/视觉领域的突破有一个本质区别：它需要和物理世界打交道。&lt;/p&gt;
&lt;p&gt;大语言模型可以在服务器上跑，用户通过浏览器访问，边际成本几乎为零。但具身智能的每一个应用都需要硬件——机器人、传感器、执行器。这意味着规模化比纯软件慢得多，成本也高得多。&lt;/p&gt;
&lt;p&gt;所以2026年的突破更多是&amp;quot;技术验证&amp;quot;层面的，离&amp;quot;大规模商业化&amp;quot;还有距离。不要指望明年就能看到人形机器人在你家做饭——那个场景至少还要5-10年。&lt;/p&gt;
&lt;h2 id="对从业者的建议"&gt;对从业者的建议&lt;/h2&gt;
&lt;p&gt;如果你在具身智能方向工作或者想进入这个方向，2026年有几个值得关注的切入点：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;世界模型 + 工业场景：这是离钱最近的方向。工厂里的机器人任务适配、质量检测、柔性制造，都有真实需求。&lt;/li&gt;
&lt;li&gt;Sim-to-Real工具链：帮企业把仿真训练的策略部署到真实机器人上，这个需求会越来越大。&lt;/li&gt;
&lt;li&gt;多模态感知融合：特别是触觉+视觉的融合，是灵巧操作的关键。&lt;/li&gt;
&lt;li&gt;基础世界模型：如果你有算力资源和大团队，这是长期价值最高的方向。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;我自己关注的是前两个方向。没有大厂的算力，也没有学术界的资源，但在工业场景的落地经验上有一些积累。用自己能做好的方式参与这个变革，就够了。&lt;/p&gt;</description></item><item><title>世界模型（world model）当下是一个好的方向吗？</title><link>https://worldsensetech.com/zh/articles/world-model-good-direction/</link><pubDate>Mon, 03 Aug 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/world-model-good-direction/</guid><description>&lt;p&gt;作为一个在这个方向上摸爬滚打了大半年的工程师，说说我的看法。&lt;/p&gt;
&lt;p&gt;先说结论：是好方向，但不是所有人都适合现在入场。&lt;/p&gt;
&lt;h2 id="为什么是好方向"&gt;为什么是好方向&lt;/h2&gt;
&lt;p&gt;世界模型解决的是一个很根本的问题：让AI不只是&amp;quot;看到&amp;quot;世界，而是&amp;quot;理解&amp;quot;世界。&lt;/p&gt;
&lt;p&gt;大语言模型已经证明了，当模型足够大、数据足够多时，它能涌现出很强的能力。但语言模型理解的是文本世界，不是物理世界。机器人要真正在现实环境中工作，需要理解物理规律——重力、摩擦力、碰撞、因果。这些东西光靠文本数据学不到。&lt;/p&gt;
&lt;p&gt;世界模型的核心思想很直觉：让模型学习*&amp;ldquo;如果我执行这个动作，环境会怎么变化&amp;rdquo;。学会了这个，机器人就可以在&amp;quot;想象&amp;quot;中训练策略，而不是在真实世界里反复试错。这对机器人来说意义重大——真实世界的试错成本高、速度慢、还可能损坏硬件。&lt;/p&gt;
&lt;p&gt;DreamerV3（2023年，Danijar Hafner等）已经证明了这条路可行。同一套参数，在55款Atari游戏上都能跑出不错的成绩，在机器人操控任务上样本效率比传统RL高出10-100倍。&lt;/p&gt;
&lt;p&gt;2024-2025年，世界模型在视频生成领域也爆发了。Sora、Kling、Vidu这些视频生成模型，本质上也是在学&amp;quot;世界会怎么变化&amp;quot;。虽然它们目前还停留在视觉层面，没有和物理控制打通，但方向是一致的。&lt;/p&gt;
&lt;h2 id="但为什么不是所有人都适合入场"&gt;但为什么不是所有人都适合入场&lt;/h2&gt;
&lt;h3 id="第一这个方向还在早期离大规模商业化有距离"&gt;第一，这个方向还在早期，离大规模商业化有距离&lt;/h3&gt;
&lt;p&gt;世界模型在仿真环境里表现很好，但Sim-to-Real迁移仍然是个大问题。仿真里训练的策略，部署到真实机器人上往往性能下降30-50%。域随机化、系统辨识这些方法能缓解，但远没有解决。如果你是想快速变现的创业者，这个方向可能太慢了。&lt;/p&gt;
&lt;h3 id="第二计算资源门槛不低"&gt;第二，计算资源门槛不低&lt;/h3&gt;
&lt;p&gt;训练一个像样的世界模型，至少需要多张A100跑几天到几周。不像写个Web应用，一台笔记本就能搞定。个人研究者或小团队需要精打细算。&lt;/p&gt;
&lt;h3 id="第三学术竞争很激烈"&gt;第三，学术竞争很激烈&lt;/h3&gt;
&lt;p&gt;这个方向的顶会论文主要来自Stanford、CMU、Berkeley、DeepMind等机构。如果你没有这些背景，纯靠自学想做出有影响力的工作，难度很大。&lt;/p&gt;
&lt;h2 id="我的建议"&gt;我的建议&lt;/h2&gt;
&lt;p&gt;如果你是想做研究、读博、进大厂AI Lab，世界模型绝对值得投入。它是具身智能的核心技术之一，未来5-10年都会有持续的研究需求。&lt;/p&gt;
&lt;p&gt;如果你是想创业或做产品，建议关注世界模型的应用层——比如用世界模型做工业机器人的快速任务适配、做仿真-to-现实的迁移工具链。这些方向离钱更近，而且大厂还没完全覆盖。&lt;/p&gt;
&lt;p&gt;如果你只是对技术感兴趣的工程师，我的建议是：先理解原理，跑通开源代码（DreamerV3有官方实现），然后在一个具体任务上实践。不需要从头训练一个大模型，学会用、学会改、学会部署，就已经很有价值了。&lt;/p&gt;
&lt;p&gt;我自己走的是最后这条路。不是学术大牛，也没有大厂的资源，就是一个对技术有热情的工程师。通过写博客、发文章来梳理自己的理解，同时也希望能帮到同样想进入这个方向的人。&lt;/p&gt;</description></item><item><title>没有博士学位，也能进入具身智能领域吗？</title><link>https://worldsensetech.com/zh/articles/embodied-ai-guide/</link><pubDate>Fri, 31 Jul 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/embodied-ai-guide/</guid><description>&lt;p&gt;前几天有个读者私信问我：&amp;ldquo;我本科毕业，做了三年嵌入式开发，想转具身智能方向，是不是必须读个博士？&amp;rdquo;&lt;/p&gt;
&lt;p&gt;这个问题我想了很久。因为我自己也不是学术出身——虽然读了硕士，但离&amp;quot;学术大牛&amp;quot;差得很远。在具身智能这个方向上，身边很多同事都是名校博士，发过顶会论文。作为一个&amp;quot;普通工程师&amp;quot;，怎么在这个领域找到自己的位置？&lt;/p&gt;
&lt;p&gt;今天这篇文章，我想诚实地聊聊这个话题。不灌鸡汤，只说实际的。&lt;/p&gt;
&lt;h2 id="先说结论可以但需要策略"&gt;先说结论：可以，但需要策略&lt;/h2&gt;
&lt;p&gt;具身智能确实是一个门槛较高的领域。它需要机器人学、强化学习、计算机视觉、甚至机械设计的交叉知识。很多核心论文来自Stanford、CMU、UC Berkeley等顶尖高校的实验组，作者清一色是教授+博士生的组合。&lt;/p&gt;
&lt;p&gt;但这不意味着没有博士学位就没机会。原因有几个：&lt;/p&gt;
&lt;p&gt;第一，工业界的需求在快速增长。人形机器人、工业协作机器人、自动驾驶等领域正在快速商业化。这些公司不仅需要算法研究者，更需要能把算法落地为产品的工程师。写得了CUDA、调得了ROS、搞得定硬件集成的工程师，在很多方面比纯学术背景的人更有优势。&lt;/p&gt;
&lt;p&gt;第二，开源生态降低了入门门槛。五年前，你想做机器人强化学习，需要一个价值几十万的硬件平台。现在，MuJoCo免费了，Isaac Sim有社区版，PyBullet完全开源。DreamerV3、TD-MPC2等算法都有高质量的开源实现。你只需要一台带GPU的电脑就能开始。&lt;/p&gt;
&lt;p&gt;第三，这个领域还在早期，机会窗口仍然开放。不像计算机视觉或NLP已经形成了相对固化的学术圈子，具身智能还在快速发展中。新的问题不断出现，旧的解决方案不断被推翻。在这种环境下，实战经验和工程直觉的价值不亚于学术论文。&lt;/p&gt;
&lt;h2 id="需要掌握的核心技能"&gt;需要掌握的核心技能&lt;/h2&gt;
&lt;p&gt;具身智能的知识体系很广，但不需要全部掌握。根据你想做的方向不同，重点也不同。我把核心技能分成三层：&lt;/p&gt;
&lt;h3 id="基础层必须掌握"&gt;基础层（必须掌握）&lt;/h3&gt;
&lt;p&gt;不管你做哪个细分方向，这些是基本功：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Python编程：不需要精通，但要能熟练写数据处理、模型训练、可视化脚本&lt;/li&gt;
&lt;li&gt;深度学习基础：理解CNN、RNN、Transformer的基本原理，能用PyTorch搭建和训练模型&lt;/li&gt;
&lt;li&gt;强化学习基础：理解MDP、策略梯度、Actor-Critic、Q-learning等核心概念&lt;/li&gt;
&lt;li&gt;线性代数和概率论：矩阵运算、概率分布、贝叶斯定理——这些是理解论文的数学基础&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="核心层至少掌握一个方向"&gt;核心层（至少掌握一个方向）&lt;/h3&gt;
&lt;p&gt;根据你的兴趣和背景，选择一个方向深入：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;仿真与Sim-to-Real：掌握一个仿真器（推荐MuJoCo），理解域随机化、系统辨识等迁移方法&lt;/li&gt;
&lt;li&gt;世界模型：理解RSSM、DreamerV3的架构，能跑通开源实现并做修改&lt;/li&gt;
&lt;li&gt;操作规划：理解运动规划（RRT、优化方法）、抓取规划、力控等&lt;/li&gt;
&lt;li&gt;感知与视觉：理解6D位姿估计、点云处理、视觉伺服等&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="加分层有余力再学"&gt;加分层（有余力再学）&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;ROS2：机器人操作系统，工业界标配&lt;/li&gt;
&lt;li&gt;C++/CUDA：性能优化，实时控制&lt;/li&gt;
&lt;li&gt;机械设计基础：理解机器人的物理约束&lt;/li&gt;
&lt;li&gt;控制理论：PID、MPC、阻抗控制等经典方法&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="推荐的学习路径"&gt;推荐的学习路径&lt;/h2&gt;
&lt;p&gt;如果你是从零开始，我建议按以下顺序学习。每个阶段大约需要1-2个月（假设每周投入10-15小时）。&lt;/p&gt;
&lt;p&gt;阶段一：打基础（1-2个月）&lt;/p&gt;
&lt;p&gt;目标：掌握深度学习和强化学习的基本概念。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;课程：李宏毅的机器学习课程（B站有，免费，讲得非常好）&lt;/li&gt;
&lt;li&gt;课程：David Silver的强化学习课程（YouTube/B站都有）&lt;/li&gt;
&lt;li&gt;实践：用PyTorch实现一个简单的DQN，在CartPole上跑通&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;阶段二：进入仿真（1-2个月）&lt;/p&gt;
&lt;p&gt;目标：熟悉一个仿真环境，能训练简单的机器人策略。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;安装MuJoCo和对应的Python绑定&lt;/li&gt;
&lt;li&gt;跟着教程让一个机械臂学会 reaching（抓取目标位置）&lt;/li&gt;
&lt;li&gt;用PPO或SAC训练一个简单任务，理解训练过程中的各种参数&lt;/li&gt;
&lt;li&gt;推荐资源：MuJoCo官方文档和示例&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;阶段三：学习世界模型（2-3个月）&lt;/p&gt;
&lt;p&gt;目标：理解DreamerV3的架构，能跑通并修改开源代码。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;读DreamerV3论文（先读一遍不求甚解，再精读关键章节）&lt;/li&gt;
&lt;li&gt;找到开源实现（GitHub上搜&amp;quot;dreamerv3&amp;quot;），跑通Atari或MuJoCo的示例&lt;/li&gt;
&lt;li&gt;尝试修改一些超参数，观察对训练的影响&lt;/li&gt;
&lt;li&gt;尝试在自己的MuJoCo任务上使用DreamerV3&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;阶段四：做一个完整项目（2-3个月）&lt;/p&gt;
&lt;p&gt;目标：从零完成一个&amp;quot;仿真训练→Sim-to-Real迁移&amp;quot;的完整流程。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;选择一个具体任务（比如机械臂抓取、四足行走）&lt;/li&gt;
&lt;li&gt;在仿真中训练策略&lt;/li&gt;
&lt;li&gt;实现域随机化，测试策略的鲁棒性&lt;/li&gt;
&lt;li&gt;如果有硬件，尝试迁移到真实机器人；如果没有，做一个详细的仿真分析报告也行&lt;/li&gt;
&lt;li&gt;把过程和结果写成博客或论文&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="一些实际的建议"&gt;一些实际的建议&lt;/h2&gt;
&lt;p&gt;在学习和实践的过程中，有几点经验我想分享：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;不要试图读完所有论文。具身智能的论文数量增长非常快，每个月都有几十篇新的工作。你不可能全部读完，也不需要。选择2-3篇核心论文（比如DreamerV3、TD-MPC2、ACT），精读理解，其他的泛读了解即可。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;动手比读论文重要10倍。很多人花大量时间读论文，但从来不动手写代码。这是最大的误区。读论文理解的是&amp;quot;idea&amp;quot;，但真正的理解来自于你亲手实现、调试、看到训练曲线时的顿悟。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;写博客是最好的学习方式。当你试图把一个概念解释给别人时，你会发现自己理解中的漏洞。而且，博客是你最好的简历——它展示了你的技术深度、表达能力和持续学习的习惯。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;找到社区。一个人学习很容易放弃。加入一些社区（比如知乎的相关话题、GitHub的讨论区、线下的机器人meetup），和同行交流。很多问题你以为只有自己遇到，其实别人早就踩过了。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;接受&amp;quot;慢&amp;quot;。具身智能是一个需要积累的领域，不像Web开发可以速成。给自己至少一年的时间来打基础，不要期望三个月就能成为专家。耐心是这个领域最重要的品质之一。&lt;/p&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;h2 id="关于职业路径"&gt;关于职业路径&lt;/h2&gt;
&lt;p&gt;最后聊一下职业发展。具身智能方向的工程师，目前主要有几条路：&lt;/p&gt;
&lt;p&gt;工业机器人的AI升级：传统工业机器人厂商（ABB、KUKA、FANUC等）正在积极引入AI能力。他们需要既懂传统机器人控制，又懂强化学习的工程师。这是一个需求量大、相对稳定的方向。&lt;/p&gt;
&lt;p&gt;人形机器人公司：近两年涌现了大量人形机器人创业公司。这些公司需要全栈型人才——能从算法做到部署。风险高，但如果公司做起来了，回报也大。&lt;/p&gt;
&lt;p&gt;仿真平台与工具：做仿真器、训练框架、可视化工具的公司。这个方向更偏软件工程，适合有扎实编程基础的工程师。&lt;/p&gt;</description></item></channel></rss>