<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>入门 on WorldSense 技术笔记</title><link>https://worldsensetech.com/zh/tags/%E5%85%A5%E9%97%A8/</link><description>Recent content in 入门 on WorldSense 技术笔记</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Sat, 01 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://worldsensetech.com/zh/tags/%E5%85%A5%E9%97%A8/index.xml" rel="self" type="application/rss+xml"/><item><title>什么是机器人世界模型？一个工程师的深度解读</title><link>https://worldsensetech.com/zh/articles/world-model-intro/</link><pubDate>Sat, 01 Aug 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/world-model-intro/</guid><description>&lt;p&gt;如果你关注AI领域的最新进展，可能已经注意到一个趋势：从ChatGPT到Sora，从AlphaFold到机器人操控，AI正在从&amp;quot;理解语言&amp;quot;走向&amp;quot;理解世界&amp;quot;。而在这个转变中，有一个概念越来越核心——世界模型（World Model）。&lt;/p&gt;
&lt;p&gt;今天这篇文章，我想从一个工程师的视角，聊聊什么是世界模型，为什么它对机器人如此重要，以及目前最有代表性的DreamerV3到底做了什么。&lt;/p&gt;
&lt;h2 id="一个直觉机器人也需要想象力"&gt;一个直觉：机器人也需要&amp;quot;想象力&amp;quot;&lt;/h2&gt;
&lt;p&gt;先做一个思想实验。&lt;/p&gt;
&lt;p&gt;想象你面前有一杯水，你伸手去推它。在你真正动手之前，你的大脑已经&amp;quot;模拟&amp;quot;了这个动作的后果——水会洒出来，杯子会滑动，你的手会变湿。你没有真正去做，但你已经&amp;quot;知道&amp;quot;了结果。&lt;/p&gt;
&lt;p&gt;这种能力，心理学家称之为&amp;quot;心智模拟&amp;quot;（Mental Simulation）。它是人类智能的核心能力之一。我们不需要每次都通过试错来学习，而是可以在脑海中&amp;quot;想象&amp;quot;行动的后果，然后选择最优的方案。&lt;/p&gt;
&lt;p&gt;传统的机器人是怎么做的呢？大多数时候，它们靠的是试错。强化学习（Reinforcement Learning）的基本逻辑就是：在环境中执行动作，观察结果，获得奖励或惩罚，然后更新策略。这就像一个蒙着眼睛的人在迷宫里乱走，靠碰壁来学习地图。&lt;/p&gt;
&lt;p&gt;问题很明显：效率太低了。一个真实的机械臂，每次试错都要消耗时间、磨损硬件，还可能造成损坏。如果机器人能像人一样，先在&amp;quot;脑海&amp;quot;中模拟一下，再决定怎么做，那效率会有质的飞跃。&lt;/p&gt;
&lt;p&gt;世界模型，就是机器人的&amp;quot;想象力&amp;quot;。&lt;/p&gt;
&lt;h2 id="世界模型到底在做什么"&gt;世界模型到底在做什么&lt;/h2&gt;
&lt;p&gt;用一句话概括：世界模型学习的是&amp;quot;如果我执行某个动作，环境会怎么变化&amp;quot;。&lt;/p&gt;
&lt;p&gt;技术上说，世界模型是一个环境的内部模拟器。它接收当前的状态和要执行的动作作为输入，输出预测的下一个状态和可能获得的奖励。形式化地表示：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-fallback" data-lang="fallback"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;`下一个状态 = 世界模型(当前状态, 动作)
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;预测奖励 = 奖励函数(当前状态, 动作)`
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;这看起来很简单，但它的能力取决于模型学到了多好的环境动态。一个好的世界模型，能够准确预测几百步甚至上千步之后的环境状态。&lt;/p&gt;
&lt;p&gt;有了世界模型之后，策略训练就变成了一个完全不同的游戏。机器人不需要在真实环境中试错，而是在世界模型构建的&amp;quot;想象空间&amp;quot;中训练。就像下棋的高手，不需要真的走每一步，而是在脑海中推演多种可能的走法，然后选择最优的。&lt;/p&gt;
&lt;h2 id="dreamerv3当前最强的世界模型之一"&gt;DreamerV3：当前最强的世界模型之一&lt;/h2&gt;
&lt;p&gt;说到世界模型在机器人领域的应用，就不得不提Dreamer系列。这是Danijar Hafner等人从2020年开始持续迭代的工作，到2023年的DreamerV3已经在多个基准测试上达到了SOTA。&lt;/p&gt;
&lt;p&gt;DreamerV3的核心架构有三个关键组件：&lt;/p&gt;
&lt;h3 id="1-rssm循环状态空间模型"&gt;1. RSSM：循环状态空间模型&lt;/h3&gt;
&lt;p&gt;RSSM（Recurrent State-Space Model）是世界模型的&amp;quot;记忆体&amp;quot;。它维护两种状态：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;确定性状态 hₜ：捕捉环境的长期趋势和规律，比如&amp;quot;物体A在桌子左边&amp;quot;这种相对稳定的信息。&lt;/li&gt;
&lt;li&gt;随机性状态 zₜ：捕捉环境的即时不确定性，比如&amp;quot;物体A的精确位置可能有几毫米的偏差&amp;quot;。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;为什么需要两种状态？因为真实世界既有确定性的一面（物理规律），也有不确定性的一面（传感噪声、未建模的动态）。传统的RNN只有一种隐状态，很难同时处理这两种特性。RSSM通过双轨设计，让模型既能记住长期规律，又能表达短期不确定性。&lt;/p&gt;
&lt;h3 id="2-actor-critic在想象中训练策略"&gt;2. Actor-Critic：在想象中训练策略&lt;/h3&gt;
&lt;p&gt;有了世界模型之后，怎么训练机器人的行为策略？DreamerV3用的是Actor-Critic方法：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Actor（演员）：负责选择动作。给定当前状态，输出一个动作分布。&lt;/li&gt;
&lt;li&gt;Critic（评论家）：负责评估。给定当前状态，预测未来能获得的累计奖励。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;关键创新在于：Actor和Critic的训练完全在想象空间中进行。从经验回放池中采样起始状态，然后用世界模型&amp;quot;展开&amp;quot;一条轨迹（默认15步），在这条想象的轨迹上计算损失并更新网络。&lt;/p&gt;
&lt;p&gt;这意味着什么？意味着机器人可以在&amp;quot;梦&amp;quot;中练习几百万次，而不需要动一下真实的硬件。&lt;/p&gt;
&lt;h3 id="3-对称对数损失让训练更稳定"&gt;3. 对称对数损失：让训练更稳定&lt;/h3&gt;
&lt;p&gt;DreamerV3相比前代最大的改进之一，是引入了对称对数（symlog）变换来处理奖励和价值的尺度问题。&lt;/p&gt;
&lt;p&gt;不同任务的奖励尺度可能差异巨大——有的任务奖励是0到1，有的是0到10000。传统方法需要对每个任务手动缩放奖励，这很不优雅。DreamerV3通过对称对数变换，自动将任意尺度的奖励压缩到一个合理范围内，实现了真正的&amp;quot;一个算法跑所有任务&amp;quot;。&lt;/p&gt;
&lt;h2 id="与传统强化学习的本质区别"&gt;与传统强化学习的本质区别&lt;/h2&gt;
&lt;p&gt;很多人会问：这不就是强化学习吗？有什么区别？&lt;/p&gt;
&lt;p&gt;区别在于样本效率。&lt;/p&gt;
&lt;p&gt;传统的强化学习（比如PPO、SAC）是无模型（model-free）的。它们直接从环境交互中学习策略，不需要理解环境的动态。这就像一个人通过不断试错来学骑自行车——摔了很多次之后，身体&amp;quot;记住&amp;quot;了怎么保持平衡。&lt;/p&gt;
&lt;p&gt;世界模型方法是有模型（model-based）的。它先学习环境的动态模型，然后在模型中训练策略。这更像一个人先理解自行车的物理原理（重心、角动量、转向几何），然后在脑海中模拟骑行的过程，最后再实际上车。&lt;/p&gt;
&lt;p&gt;在实际效果上，DreamerV3的样本效率通常比PPO高出10到100倍。也就是说，达到同样的性能，DreamerV3可能只需要真实环境交互10万步，而PPO需要1000万步。对于机器人来说，这意味着训练时间从几周缩短到几小时。&lt;/p&gt;
&lt;h2 id="应用场景不只是游戏"&gt;应用场景：不只是游戏&lt;/h2&gt;
&lt;p&gt;DreamerV3最初在Atari游戏上展示了惊人的能力——用同一套超参数，在55款游戏中都取得了不错的成绩。但它的能力远不止于此。&lt;/p&gt;
&lt;p&gt;在机器人领域，世界模型已经开始在以下场景中展现价值：&lt;/p&gt;
&lt;p&gt;工业装配：机器人需要学会将不同形状的零件装配到产品上。传统方法需要为每种零件编写专门的程序，而世界模型方法可以通过想象训练快速适配新零件。&lt;/p&gt;
&lt;p&gt;灵巧操作：比如翻转物体、拧瓶盖、系鞋带等需要精细力控的任务。这些任务在仿真中很难精确建模，世界模型可以从少量真实数据中学习到复杂的接触动态。&lt;/p&gt;
&lt;p&gt;导航与探索：在未知环境中规划路径。世界模型可以预测&amp;quot;如果我往那边走，会看到什么&amp;quot;，从而做出更好的探索决策。&lt;/p&gt;
&lt;h2 id="局限性与未来"&gt;局限性与未来&lt;/h2&gt;
&lt;p&gt;当然，世界模型不是万能的。它目前面临几个主要挑战：&lt;/p&gt;
&lt;p&gt;长程预测误差累积：世界模型的预测不可能完美，每一步都有小误差，多步之后误差会指数级放大。目前DreamerV3的想象步数限制在15步左右，更长的预测会变得不可靠。&lt;/p&gt;
&lt;p&gt;复杂物理场景：对于涉及流体、软体、复杂接触的场景，世界模型的预测精度还不够高。比如抓取一块布料，布料的形变很难准确预测。&lt;/p&gt;
&lt;p&gt;计算成本：训练一个高质量的世界模型需要大量的计算资源。虽然推理时很高效，但训练阶段并不便宜。&lt;/p&gt;
&lt;p&gt;这些挑战也是当前研究的前沿方向。我相信在未来2-3年内，随着模型架构的改进和计算效率的提升，世界模型会在更多真实机器人场景中落地。&lt;/p&gt;
&lt;h2 id="写在最后"&gt;写在最后&lt;/h2&gt;
&lt;p&gt;世界模型的核心思想其实很朴素：先理解世界，再决定行动。这和人类的学习方式是一致的。我们不会一开始就盲目尝试，而是先观察、理解、预测，然后才采取行动。&lt;/p&gt;</description></item></channel></rss>