<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>世界模型 on WorldSense 技术笔记</title><link>https://worldsensetech.com/zh/categories/%E4%B8%96%E7%95%8C%E6%A8%A1%E5%9E%8B/</link><description>Recent content in 世界模型 on WorldSense 技术笔记</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Wed, 12 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://worldsensetech.com/zh/categories/%E4%B8%96%E7%95%8C%E6%A8%A1%E5%9E%8B/index.xml" rel="self" type="application/rss+xml"/><item><title>世界模型架构演进：RSSM、Transformer 与统一世界模型</title><link>https://worldsensetech.com/zh/articles/world-model-transformer/</link><pubDate>Wed, 12 Aug 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/world-model-transformer/</guid><description>&lt;p&gt;前面几篇文章中，我们深入讲解了 DreamerV3 的 RSSM 架构和训练技巧。RSSM 是强化学习世界模型中的经典设计，但如果你关注最近的研究，会发现一个明显的趋势：世界模型正在走向 Transformer 化。&lt;/p&gt;
&lt;p&gt;从 Google 的 UniSim 到 Wayve 的 GAIA-1，从 NVIDIA 的 Cosmos 到国内具身智能团队的方案，Transformer 正成为大规模世界模型的重要技术路线。&lt;/p&gt;
&lt;p&gt;为什么会这样？RSSM 有什么问题？Transformer 带来了什么优势？世界模型的架构演进方向是什么？&lt;/p&gt;
&lt;p&gt;这篇文章梳理这条技术路线。&lt;/p&gt;
&lt;p&gt;在展开之前，先澄清一个概念。所谓统一世界模型（unified world model），并不是指一个模型精确复制整个物理世界，而是希望通过统一的表示空间同时理解视觉、语言、动作和环境动态——让同一个模型既能&amp;quot;看&amp;quot;懂场景，又能&amp;quot;想&amp;quot;清因果，还能&amp;quot;做&amp;quot;出决策。这是当前世界模型研究的一个前沿方向。&lt;/p&gt;
&lt;h2 id="rssm-的设计逻辑与局限"&gt;RSSM 的设计逻辑与局限&lt;/h2&gt;
&lt;p&gt;先回顾一下 RSSM 为什么被设计出来。&lt;/p&gt;
&lt;p&gt;RSSM（Recurrent State-Space Model）的核心思想是将隐状态分成两个轨道：确定性状态（deterministic state）和随机性状态（stochastic state）。确定性状态用 GRU 更新，捕捉规律性的动态；随机性状态通过离散分类分布采样——DreamerV3 使用 32 个离散 categorical 变量，每个变量包含 64 个类别，组合形成容量为 64^32 的随机隐空间，捕捉环境的不确定性。&lt;/p&gt;
&lt;p&gt;这个设计有几个优点：&lt;/p&gt;
&lt;p&gt;计算效率高。GRU 是循环网络，每一步只需要上一步的隐状态，不需要处理整个序列。训练和推理的内存开销较小。&lt;/p&gt;
&lt;p&gt;隐空间结构清晰。确定性 + 随机性的双轨道设计，让模型同时学到&amp;quot;规律&amp;quot;和&amp;quot;不确定性&amp;quot;。这对物理世界的建模很重要——宏观物理规律通常具有较强确定性，而观测和环境扰动具有随机性。&lt;/p&gt;
&lt;p&gt;想象训练方便。在隐空间中可以方便地&amp;quot;想象&amp;quot;未来轨迹：从当前状态出发，用 GRU 逐步推进，每一步采样随机状态，得到一系列隐状态，再解码成观测。&lt;/p&gt;
&lt;p&gt;但 RSSM 也有几个明显的局限：&lt;/p&gt;
&lt;p&gt;长程依赖问题。RSSM 通过 deterministic hidden state 维护历史信息，但由于状态更新仍是递归形式，超长时间跨度的信息需要压缩到固定维度的隐状态中，可能造成信息瓶颈。当任务需要记住很久以前的信息时（如延迟奖励、长程因果链），RSSM 的表现可能不够好。&lt;/p&gt;
&lt;p&gt;并行化受限。循环网络在时间维度上是序列化的——每一步依赖上一步的输出。不过 RSSM 训练并非完全串行：observation encoder 可以并行处理，rollout imagination 也可以在 batch 维度并行。真正的瓶颈在于时间维度上的依赖关系，这使得训练速度受限于序列长度。&lt;/p&gt;</description></item><item><title>DreamerV3 训练技巧：从踩坑到收敛的实战经验</title><link>https://worldsensetech.com/zh/articles/dreamerv3-training-tips/</link><pubDate>Tue, 11 Aug 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/dreamerv3-training-tips/</guid><description>&lt;p&gt;上一篇文章梳理了世界模型的四条表征路线。今天我们回到 DreamerV3 的实战主题，聊聊训练过程中的那些坑和技巧。本文基于 DreamerV3 commit &lt;code&gt;e3f02248&lt;/code&gt;、JAX + Haiku、MuJoCo + DM Control 的本地实验环境，不同版本的参数名和配置可能有差异。&lt;/p&gt;
&lt;p&gt;DreamerV3 是目前最开源、最成熟的世界模型实现之一。但如果你真的动手训练过，一定知道这个过程并不轻松——环境配置、超参数调优、训练不稳定、收敛慢……各种坑。&lt;/p&gt;
&lt;p&gt;这篇文章总结我在训练 DreamerV3 过程中遇到的常见问题和解决方案，希望能帮你少走弯路。&lt;/p&gt;
&lt;h2 id="环境配置的坑"&gt;环境配置的坑&lt;/h2&gt;
&lt;h3 id="1-mujoco-版本问题"&gt;1. MuJoCo 版本问题&lt;/h3&gt;
&lt;p&gt;DreamerV3 的官方实现基于 JAX + MuJoCo。但 MuJoCo 的版本选择很关键：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;MuJoCo 2.x vs 3.x。官方代码基于 MuJoCo 2.x，但 3.x 版本有性能改进。如果用 3.x，需要修改部分 API 调用。&lt;/li&gt;
&lt;li&gt;mujoco-py vs mujoco。mujoco-py 是旧的 Python 绑定，已经停止维护。建议直接用官方的 mujoco 包。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;建议：优先使用与你当前 DreamerV3 commit 匹配的 MuJoCo 版本，不要一开始就升级整个环境。&lt;/p&gt;
&lt;h3 id="2-jax-的-gpu-配置"&gt;2. JAX 的 GPU 配置&lt;/h3&gt;
&lt;p&gt;JAX 的 GPU 支持需要正确安装 CUDA 和 cuDNN。常见问题：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;CUDA 版本不匹配。JAX 对 CUDA 版本有严格要求，安装前查看官方文档。&lt;/li&gt;
&lt;li&gt;GPU 内存不足。JAX 默认会占用所有 GPU 内存。可以设置 &lt;code&gt;XLA_PYTHON_CLIENT_MEM_FRACTION=0.9&lt;/code&gt; 限制内存使用。如果遇到编译阶段内存峰值过高，也可以设置 &lt;code&gt;XLA_PYTHON_CLIENT_PREALLOCATE=false&lt;/code&gt; 关闭预分配。&lt;/li&gt;
&lt;li&gt;多 GPU 问题。JAX 的多 GPU 支持和 PyTorch 不同，需要特别配置。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;下图是 DreamerV3 在 RTX 5090D 上训练时的实际 GPU 占用情况，显存占用约 25.6GB（32GB 的 78%），GPU 利用率 91%：
![DreamerV3 训练时 GPU 占用情况](/images/nvidia smi.png) 图：RTX 5090D 上 DreamerV3 训练时的 GPU 显存占用（25.6GB / 32GB，利用率 91%）&lt;/p&gt;</description></item><item><title>世界模型如何表示世界：四条表征路线与机器人适应能力</title><link>https://worldsensetech.com/zh/articles/world-model-representations/</link><pubDate>Mon, 10 Aug 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/world-model-representations/</guid><description>&lt;p&gt;前面我们用 MuJoCo 和 Isaac Sim 的对比，理清了仿真器的选择。但不管用哪个仿真器，世界模型都面临一个更根本的问题：到底用什么来表示&amp;quot;世界&amp;quot;？&lt;/p&gt;
&lt;p&gt;这个问题听起来抽象，但它直接决定了世界模型能做什么、不能做什么。就像你选错了数据结构，后面的算法再精妙也救不回来。&lt;/p&gt;
&lt;p&gt;我把当前世界模型的表征方式归纳为四条主要路线。需要说明的是，这四条路线并不是严格互斥的——它们分别对应表征的不同维度：隐空间压缩是表征空间的选择，视觉生成是输出空间的选择，显式几何建模是世界几何的表示方式，对象级结构化是信息的组织方式。更准确地说，这四条路线不是互相替代的模型类别，而是世界模型设计中的四种归纳偏置（inductive bias）——不同表征给模型加入了不同的先验假设。实际系统中，它们经常交叉组合。但理解每条路线的核心逻辑和局限，是做出正确设计选择的前提。&lt;/p&gt;
&lt;h2 id="路线一隐状态latent-state"&gt;路线一：隐状态（Latent State）&lt;/h2&gt;
&lt;p&gt;代表：DreamerV3、TD-MPC2&lt;/p&gt;
&lt;p&gt;核心思路：把观测（图像、传感器数据）压缩成一个固定维度的向量，在这个隐空间里建模动态、训练策略。&lt;/p&gt;
&lt;p&gt;DreamerV3 的 RSSM 使用循环神经网络维护确定性状态（4096 维），并结合离散随机变量（32 个类别变量，每个 64 类）来表示不确定性，两者共同用于预测未来。TD-MPC2 更激进——512 维隐状态，不要求世界模型重建原始观测，而是在任务相关的隐空间中直接做模型预测控制。&lt;/p&gt;
&lt;p&gt;这个路线解决什么问题？&lt;/p&gt;
&lt;p&gt;样本效率和计算速度。隐状态是高度压缩的表征，一个 64×64×3 的图像被压缩成几千维的向量。在这个压缩空间里做想象训练，比直接在像素空间里预测快几个数量级。DreamerV3 相比像素级世界模型具有更低的计算需求，可以在有限算力下完成高效训练。TD-MPC2 在多个连续控制任务上也展示了较高的训练效率。&lt;/p&gt;
&lt;p&gt;而且隐状态天然适合做控制。策略网络可以直接从隐状态输出动作，世界模型可以在隐空间里做 rollout，不需要生成完整的图像。对于实时控制场景（如机械臂操作），这种效率是必须的。&lt;/p&gt;
&lt;p&gt;卡在哪里？&lt;/p&gt;
&lt;p&gt;隐空间是个黑箱。它通常不提供显式可访问的 3D 结构——模型内部可能编码了深度、位置等空间线索，但这些信息难以被直接用于几何推理。它学到的是&amp;quot;做了这个动作后，隐向量会从 A 变成 B&amp;quot;，但 A 和 B 里面到底包含了什么空间信息，完全不透明。&lt;/p&gt;
&lt;p&gt;这带来一个直接后果：长时间预测容易漂移。由于隐状态通常不显式约束几何一致性，每预测一步就可能引入微小误差，误差累积后，想象轨迹逐渐偏离真实动态。DreamerV3 通常采用较短的 imagination horizon（例如 15 步），这是在模型误差累积、价值估计偏差和计算成本之间的工程折中。&lt;/p&gt;
&lt;p&gt;另一个问题是迁移。如果隐空间主要由单一任务数据学习得到，其状态语义往往缺少显式结构约束，跨场景迁移时可能需要重新适配。&lt;/p&gt;
&lt;h2 id="路线二像素视频pixelvideo"&gt;路线二：像素/视频（Pixel/Video）&lt;/h2&gt;
&lt;p&gt;代表：NVIDIA Cosmos、1X World Model&lt;/p&gt;
&lt;p&gt;核心思路：直接预测未来的图像或视频帧。给世界模型一段过去的视频 + 动作序列，它生成未来的视频。&lt;/p&gt;
&lt;p&gt;Cosmos 定位为 Physical AI 的基础模型，用两条路线处理视觉信息：一条是自回归的离散视觉 token（类似 GPT 预测下一个 token），一条是扩散模型生成连续帧。它的目标不仅是预测视频，更是通过大规模视觉生成获得通用的物理先验。1X World Model 也采用类似思路，用视频生成模型预测未来画面，同时预测离散隐状态码。&lt;/p&gt;
&lt;p&gt;这个路线解决什么问题？&lt;/p&gt;</description></item><item><title>TD-MPC：世界模型如何用于机器人控制？</title><link>https://worldsensetech.com/zh/articles/td-mpc-world-model-control/</link><pubDate>Fri, 07 Aug 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/td-mpc-world-model-control/</guid><description>&lt;p&gt;上一篇文章我们拆解了 RSSM 的双轨状态设计，理解了 Dreamer 系列如何在隐空间中&amp;quot;想象&amp;quot;未来。但 RSSM 并不是世界模型用于机器人控制的唯一路线。今天聊另一条重要路线：TD-MPC（Temporal Difference Model Predictive Control）。&lt;/p&gt;
&lt;p&gt;如果说 Dreamer 的核心是利用学习到的世界模型，在隐空间中进行 imagined rollout，并通过 actor-critic 方法优化策略，那 TD-MPC 的核心思路更直接：学一个世界模型，然后在模型里做规划（planning），选出最优动作序列直接执行。它不把策略网络作为唯一决策方式，而是利用世界模型进行在线规划，并结合学习到的策略先验提高搜索效率。&lt;/p&gt;
&lt;h2 id="为什么需要-model-predictive-control"&gt;为什么需要 Model Predictive Control&lt;/h2&gt;
&lt;p&gt;先退一步。传统的强化学习（比如 DQN、PPO）学的是一个策略 π(a|s)——给定当前状态，直接输出动作。这个策略是在大量试错中训练出来的，一旦训练完成，推理时只需要前向传播一次。&lt;/p&gt;
&lt;p&gt;但这种方式有两个问题：&lt;/p&gt;
&lt;p&gt;第一，样本效率低。策略需要大量交互数据才能学好，而真实机器人的交互成本很高。&lt;/p&gt;
&lt;p&gt;第二，缺乏&amp;quot;前瞻性&amp;quot;。策略网络只看当前状态就决定动作，不会主动&amp;quot;想一想如果我这样做，接下来几步会怎样&amp;quot;。&lt;/p&gt;
&lt;p&gt;Model Predictive Control（MPC）的思路完全不同：在每个时间步，基于当前状态，在模型中模拟多条未来轨迹，评估每条轨迹的累积回报，选择回报最高的那条轨迹的第一个动作执行。然后到下一个时间步，重新规划。&lt;/p&gt;
&lt;p&gt;这就像下棋：不是靠直觉走一步，而是向前推演几步，选最好的走法。&lt;/p&gt;
&lt;h2 id="td-mpc-的核心设计"&gt;TD-MPC 的核心设计&lt;/h2&gt;
&lt;p&gt;TD-MPC（Hansen et al., 2022）的关键贡献在于：它证明了一个面向控制任务学习的隐空间动力学模型，可以与 MPC 规划结合，并通过 TD 学习目标获得高效控制能力。注意，MPC 和 model-based RL 的结合并不是新概念——TD-MPC 的创新在于用 TD 目标替代重建损失来训练世界模型。&lt;/p&gt;
&lt;h3 id="世界模型的结构"&gt;世界模型的结构&lt;/h3&gt;
&lt;p&gt;TD-MPC 的核心组件包括状态编码器、隐空间动力学模型、奖励预测模型，以及用于价值评估的 Q 网络：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;状态编码器（Encoder）&lt;/li&gt;
&lt;/ol&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-fallback" data-lang="fallback"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;`z_t = Encoder(o_t)`
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;把高维观测（比如图像）压缩到一个低维的隐状态 z_t。这个隐状态不需要像 RSSM 那样拆成确定性和随机性两部分——TD-MPC 用的是确定性隐状态，结构更简单。&lt;/p&gt;
&lt;ol start="2"&gt;
&lt;li&gt;动力学模型（Dynamics Model）&lt;/li&gt;
&lt;/ol&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-fallback" data-lang="fallback"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;`z_{t+1} = f(z_t, a_t)`
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;给定当前隐状态和动作，预测下一步的隐状态。这就是世界模型的核心——它学会了环境的状态转移规律。&lt;/p&gt;</description></item><item><title>世界模型 + VLA：用想象力训练机器人</title><link>https://worldsensetech.com/zh/articles/world-model-synthetic-data-for-vla/</link><pubDate>Thu, 06 Aug 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/world-model-synthetic-data-for-vla/</guid><description>&lt;p&gt;上一篇&lt;a href="https://worldsensetech.com/zh/articles/world-model-lab-setup/"&gt;从零搭建世界模型实验环境&lt;/a&gt;，我们跑通了 DreamerV3。有读者问：训练好的世界模型能做什么？&lt;/p&gt;
&lt;p&gt;今天聊一个更前沿的话题：怎么用世界模型生成合成数据，来增强 VLA（视觉-语言-动作模型）的训练。这是近年来机器人基础模型领域受到广泛关注的研究方向之一。&lt;/p&gt;
&lt;h2 id="为什么-vla-需要合成数据"&gt;为什么 VLA 需要合成数据&lt;/h2&gt;
&lt;p&gt;VLA 的核心能力是让机器人&amp;quot;听懂人话&amp;quot;——你指着桌上的杯子说&amp;quot;把那个红色的拿给我&amp;quot;，它能理解语言指令并执行动作。&lt;/p&gt;
&lt;p&gt;但训练这样的模型需要海量数据：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;真实数据采集成本高：需要人类示范，每条数据都要人操作机器人&lt;/li&gt;
&lt;li&gt;场景覆盖有限：真实环境难以覆盖所有边界情况（比如光线变化、物体遮挡）&lt;/li&gt;
&lt;li&gt;危险动作无法采集：某些失败案例在真实世界太危险，无法收集&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这就是世界模型的价值所在——它可以在&amp;quot;想象&amp;quot;中生成大量合成数据，弥补真实数据的不足。&lt;/p&gt;
&lt;h2 id="世界模型如何生成合成数据"&gt;世界模型如何生成合成数据&lt;/h2&gt;
&lt;p&gt;回顾一下世界模型的核心能力：给定当前状态和动作，预测未来会发生什么。&lt;/p&gt;
&lt;p&gt;需要说明的是，机器人领域合成数据的来源不仅限于 Dreamer 这类 latent world model，还包括物理模拟器（MuJoCo、Isaac Sim、ManiSkill）、神经渲染环境以及基于视频生成的世界模型。Dreamer 系列是其中适合理解 model-based RL 和 latent imagination 的代表，但实际研究中数据来源更加多元。&lt;/p&gt;
&lt;p&gt;在 DreamerV3 中，RSSM（循环状态空间模型）可以在想象空间中做 rollout：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;从真实观测编码初始 latent state（后验状态）&lt;/li&gt;
&lt;li&gt;采样或指定动作序列&lt;/li&gt;
&lt;li&gt;RSSM 逐步预测 latent state 转移和预期奖励&lt;/li&gt;
&lt;li&gt;通过 observation model 解码 latent state 为观测&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;世界模型生成的是潜在轨迹（latent trajectories），经过视觉解码器和任务条件映射后，可以进一步构造机器人学习需要的视觉-语言-动作数据。&lt;/p&gt;
&lt;p&gt;需要注意：DreamerV3 的 latent imagination 与近年来基于 diffusion/transformer 的大规模视频生成模型不同。DreamerV3 的核心优势在于策略学习（latent dynamics、reward prediction），而不是直接生成高保真机器人视觉数据。用 DreamerV3 decoder 直接重建的图像往往模糊、细节缺失，长时间 rollout 还可能出现物体身份漂移。这也是为什么机器人领域正在转向 video diffusion world model 和 transformer-based world model（如 UniSim、RoboGen、GAIA-1）来获取更高质量的视觉合成数据。&lt;/p&gt;</description></item><item><title>Sim-to-Real太难？世界模型驱动的自适应迁移方法</title><link>https://worldsensetech.com/zh/articles/sim-to-real-transfer/</link><pubDate>Wed, 05 Aug 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/sim-to-real-transfer/</guid><description>&lt;p&gt;这是世界模型系列文章的第四篇。前三篇我们聊了世界模型的基本概念、RSSM的核心原理、以及具身智能的入门路径。今天聊一个更偏实战的话题：仿真里训练的策略，到底怎么部署到真实机器人上？&lt;/p&gt;
&lt;p&gt;这个问题困扰了机器人AI领域将近十年。世界模型在仿真环境里表现惊艳——DreamerV3的样本效率比传统RL高出10-100倍。但一旦部署到真实机器人，性能往往下降30-50%。这个差距，就是著名的&amp;quot;Sim-to-Real Gap&amp;quot;。&lt;/p&gt;
&lt;p&gt;这篇文章，我想从工程师的视角，聊聊这个问题为什么难，以及世界模型提供了哪些新的解决思路。&lt;/p&gt;
&lt;h2 id="sim-to-real的三大挑战"&gt;Sim-to-Real的三大挑战&lt;/h2&gt;
&lt;p&gt;先搞清楚问题出在哪里。仿真和真实世界之间的差距，主要来自三个方面：&lt;/p&gt;
&lt;h3 id="1-域偏移domain-shift"&gt;1. 域偏移（Domain Shift）&lt;/h3&gt;
&lt;p&gt;仿真器的物理参数和真实世界不可能完全一致。摩擦系数差0.1、质量差5克、电机响应慢10毫秒——这些微小差异在仿真里看不出来，但策略部署后会被放大。&lt;/p&gt;
&lt;p&gt;更麻烦的是，这些参数往往是未知的。你不知道真实世界的精确摩擦系数是多少，只能猜一个范围。&lt;/p&gt;
&lt;h3 id="2-未建模动态unmodeled-dynamics"&gt;2. 未建模动态（Unmodeled Dynamics）&lt;/h3&gt;
&lt;p&gt;仿真器只能模拟已知的物理规律。但真实世界有很多&amp;quot;意外&amp;quot;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;柔性物体的形变（比如抓取一块布料，布料的褶皱无法精确预测）&lt;/li&gt;
&lt;li&gt;接触非线性（两个表面接触时的粘滑效应、微小振动）&lt;/li&gt;
&lt;li&gt;传感噪声（相机图像的光照变化、力传感器的漂移）&lt;/li&gt;
&lt;li&gt;外部干扰（有人碰了一下桌子、地面轻微震动）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这些动态在仿真里要么被简化，要么完全忽略。策略在仿真里学的是&amp;quot;理想世界&amp;quot;的规律，到真实世界就懵了。&lt;/p&gt;
&lt;h3 id="3-安全约束safety-constraints"&gt;3. 安全约束（Safety Constraints）&lt;/h3&gt;
&lt;p&gt;在仿真里，策略可以随便试错——撞坏了重启就行。但在真实世界，机器人撞坏了是真坏了，还可能伤到人。&lt;/p&gt;
&lt;p&gt;这意味着部署到真实世界的策略必须满足安全约束：不能超出关节限位、不能产生过大的力、不能进入危险区域。这些约束在仿真训练时往往没有被充分考虑。&lt;/p&gt;
&lt;h2 id="传统方法域随机化的局限性"&gt;传统方法：域随机化的局限性&lt;/h2&gt;
&lt;p&gt;过去几年，Sim-to-Real迁移的主流方法是域随机化（Domain Randomization）。&lt;/p&gt;
&lt;p&gt;思路很直觉：既然不知道真实世界的精确参数，那就在仿真里随机化这些参数。训练时，每次episode都用不同的摩擦系数、质量、光照条件、传感噪声。策略在这么多&amp;quot;不同的世界&amp;quot;里训练，总有一个和真实世界接近。&lt;/p&gt;
&lt;p&gt;这个方法确实有效。OpenAI的Rubik&amp;rsquo;s Cube机器人（2019年）就是用域随机化实现的——在仿真里训练，直接部署到真实世界，成功率达到90%以上。&lt;/p&gt;
&lt;p&gt;但域随机化有几个根本性的局限：&lt;/p&gt;
&lt;p&gt;第一，随机化范围难确定。如果范围太小，覆盖不到真实世界的参数；如果范围太大，策略会变得过于保守，什么都做不好。&lt;/p&gt;
&lt;p&gt;第二，只能处理已知的不确定性。域随机化只能随机化你&amp;quot;知道要随机化&amp;quot;的参数。但未建模动态（比如柔性形变）你根本不知道该怎么随机化。&lt;/p&gt;
&lt;p&gt;第三，样本效率低。为了覆盖足够大的参数空间，需要大量的训练数据。对于复杂的机器人任务，训练时间可能长达数周。&lt;/p&gt;
&lt;h2 id="新思路用世界模型作为桥梁"&gt;新思路：用世界模型作为&amp;quot;桥梁&amp;quot;&lt;/h2&gt;
&lt;p&gt;世界模型为Sim-to-Real迁移提供了一个全新的思路：不让策略直接从仿真跳到真实世界，而是让世界模型作为中间的&amp;quot;桥梁&amp;quot;。&lt;/p&gt;
&lt;p&gt;核心思想是：世界模型学习了环境的动态规律。如果这个世界模型足够好，它应该能同时模拟仿真环境和真实世界。策略在世界模型的&amp;quot;想象空间&amp;quot;中训练，而不是在仿真器中训练。这样策略学到的不是&amp;quot;仿真世界的规律&amp;quot;，而是&amp;quot;更通用的环境规律&amp;quot;。&lt;/p&gt;
&lt;p&gt;具体来说，世界模型驱动的Sim-to-Real迁移有三个关键机制：&lt;/p&gt;
&lt;h3 id="机制一世界模型驱动的域适应"&gt;机制一：世界模型驱动的域适应&lt;/h3&gt;
&lt;p&gt;传统域随机化是在仿真器层面随机化参数。世界模型方法则是在模型层面做适应。&lt;/p&gt;
&lt;p&gt;流程是这样的：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;在仿真环境中收集大量数据，训练一个世界模型&lt;/li&gt;
&lt;li&gt;在真实世界中收集少量数据（可能只有几分钟的演示）&lt;/li&gt;
&lt;li&gt;用真实数据微调世界模型，让它&amp;quot;适应&amp;quot;真实世界的动态&lt;/li&gt;
&lt;li&gt;在适应后的世界模型中重新训练策略&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;这个方法的优势在于：世界模型的参数量远小于仿真器的参数量。微调世界模型比重新校准仿真器快得多，而且只需要少量真实数据。&lt;/p&gt;
&lt;p&gt;举个例子：一个机械臂抓取任务，仿真里训练的世界模型预测的摩擦力是0.3，但真实世界的摩擦力是0.35。传统方法需要重新校准仿真器的摩擦参数，可能需要几个小时。而世界模型方法只需要用真实数据微调几轮，模型就能学会正确的摩擦力，可能只要几分钟。&lt;/p&gt;
&lt;h3 id="机制二渐进式信任迁移"&gt;机制二：渐进式信任迁移&lt;/h3&gt;
&lt;p&gt;即使世界模型适应得很好，直接把策略部署到真实世界还是有风险。渐进式信任迁移的思路是：分阶段部署，每一步都有安全约束。&lt;/p&gt;
&lt;p&gt;具体分为三个阶段：&lt;/p&gt;
&lt;p&gt;阶段一：纯仿真训练&lt;/p&gt;
&lt;p&gt;策略完全在世界模型的想象空间中训练。这个阶段策略可能还不稳定，但没关系，因为在仿真里。&lt;/p&gt;
&lt;p&gt;阶段二：混合环境训练&lt;/p&gt;
&lt;p&gt;策略在仿真和真实世界之间交替训练。比如奇数episode在仿真里跑，偶数episode在真实世界里跑。真实世界的episode中，加入安全约束（比如限制速度、限制力的范围）。&lt;/p&gt;
&lt;p&gt;这个阶段的关键是信任度评估：世界模型会预测&amp;quot;在真实世界中执行这个动作的后果&amp;quot;。如果预测的不确定性太高，就降低策略的探索强度，或者切换到更保守的行为。&lt;/p&gt;
&lt;p&gt;阶段三：真实世界部署&lt;/p&gt;
&lt;p&gt;策略完全在真实世界中运行。但世界模型仍然在后台运行，持续预测环境动态。如果预测和实际观测偏差太大，触发安全机制（比如减速、停止、请求人工干预）。&lt;/p&gt;
&lt;p&gt;这种渐进式的方法，核心优势是安全。每一步都有安全保障，不会出现&amp;quot;仿真里好好的，一部署就撞坏&amp;quot;的情况。&lt;/p&gt;
&lt;h3 id="机制三在线模型适配"&gt;机制三：在线模型适配&lt;/h3&gt;
&lt;p&gt;即使部署成功了，真实世界还在不断变化。温度变了、零件磨损了、桌面被移动了——这些都会影响策略的性能。&lt;/p&gt;
&lt;p&gt;在线模型适配的思路是：部署后，世界模型持续从真实数据中学习，不断修正自己的预测。&lt;/p&gt;
&lt;p&gt;具体做法：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;策略执行动作时，世界模型同时预测下一个状态&lt;/li&gt;
&lt;li&gt;真实传感器返回实际观测&lt;/li&gt;
&lt;li&gt;比较预测和实际观测，计算误差&lt;/li&gt;
&lt;li&gt;用这个误差更新世界模型的参数（在线学习）&lt;/li&gt;
&lt;li&gt;更新后的世界模型用于下一步的预测和策略更新&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这个机制让策略能够持续适应环境变化。比如机械臂的关节随着使用会磨损，摩擦力会逐渐变化。在线适配的世界模型能捕捉到这种变化，策略也能相应调整。&lt;/p&gt;
&lt;h2 id="安全约束控制屏障函数"&gt;安全约束：控制屏障函数&lt;/h2&gt;
&lt;p&gt;前面提到了安全约束，这里展开说一下具体的实现方法。&lt;/p&gt;</description></item><item><title>从1分钟到24小时：ABot-World-0突破的核心意义</title><link>https://worldsensetech.com/zh/articles/abot-world-0-24h-inference/</link><pubDate>Wed, 05 Aug 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/abot-world-0-24h-inference/</guid><description>&lt;p&gt;做世界模型方向大半年，这次高德 ABot-World-0 的更新值得关注，因为它解决的是这个领域一直绕不过去的问题：长时间尺度下的世界一致性。&lt;/p&gt;
&lt;h2 id="过去交互式世界模型最大的瓶颈是什么"&gt;过去交互式世界模型最大的瓶颈是什么&lt;/h2&gt;
&lt;p&gt;不是&amp;quot;不能生成画面&amp;quot;，而是无法保持长期一致性。&lt;/p&gt;
&lt;p&gt;短时间生成（几十秒到几分钟）：人物外观还能保持，场景还能连贯，动作还能响应。&lt;/p&gt;
&lt;p&gt;但时间拉长后：物体位置漂移、场景规则变化、角色身份丢失、前后状态不一致。&lt;/p&gt;
&lt;p&gt;所以世界模型一直停留在&amp;quot;演示级&amp;quot;——能生成一段炫酷的短视频，但没法持续运行。&lt;/p&gt;
&lt;p&gt;ABot-World-0 将推理时长从分钟级提升到24小时，真正突破的是：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;让模型从&amp;quot;生成一个短暂的未来&amp;quot;，变成&amp;quot;持续维护一个世界状态&amp;quot;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2 id="第一交互式世界模型开始具备持续运行能力"&gt;第一，交互式世界模型开始具备&amp;quot;持续运行能力&amp;quot;&lt;/h2&gt;
&lt;p&gt;以前的范式：&lt;/p&gt;
&lt;p&gt;输入 → 生成几十秒未来 → 结束。&lt;/p&gt;
&lt;p&gt;现在的范式：&lt;/p&gt;
&lt;p&gt;当前世界状态 → 用户行动 → 继续演化 → 数小时甚至一天。&lt;/p&gt;
&lt;p&gt;这意味着世界模型不再像视频播放器，而更像：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;游戏服务器&lt;/li&gt;
&lt;li&gt;虚拟环境&lt;/li&gt;
&lt;li&gt;AI Agent 沙盒&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;AI 可以在里面长期探索，而不是只能观看一段生成结果。&lt;/p&gt;
&lt;h2 id="第二解决了世界模型落地最大的工程障碍时间尺度"&gt;第二，解决了世界模型落地最大的工程障碍：时间尺度&lt;/h2&gt;
&lt;p&gt;很多 AI 能力的问题，不是瞬间预测能力不足，而是：能不能在很长时间里保持正确。&lt;/p&gt;
&lt;p&gt;比如：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;自动驾驶需要预测几秒后的车辆行为、几分钟后的交通变化&lt;/li&gt;
&lt;li&gt;机器人需要连续执行任务、保持环境记忆&lt;/li&gt;
&lt;li&gt;游戏Agent需要在开放世界长期活动&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;24小时推理能力意味着世界模型开始接近真实应用需要的时间尺度。&lt;/p&gt;
&lt;p&gt;但需要澄清：24小时稳定推理主要证明的是稳定运行能力，不代表24小时物理完全一致、细节无漂移、或具备真实世界理解。长时间演化后质量仍会有衰减，这是当前所有自回归模型的共性问题。&lt;/p&gt;
&lt;h2 id="第三降低了世界模拟的使用门槛"&gt;第三，降低了世界模拟的使用门槛&lt;/h2&gt;
&lt;p&gt;5B参数，19GiB显存，单张RTX 5090就能跑，Apache 2.0开源。&lt;/p&gt;
&lt;p&gt;意义不是简单&amp;quot;省算力&amp;quot;，而是：&lt;/p&gt;
&lt;p&gt;以前：世界模型 = 大公司实验室资产&lt;/p&gt;
&lt;p&gt;未来：世界模型 = 开发者可以部署的基础模型&lt;/p&gt;
&lt;p&gt;类似 Stable Diffusion 让图像生成从云端服务变成开发生态。&lt;/p&gt;
&lt;h2 id="第四对机器人的意义是提供更长的想象空间"&gt;第四，对机器人的意义是提供更长的&amp;quot;想象空间&amp;quot;&lt;/h2&gt;
&lt;p&gt;机器人训练最大的成本是真实世界试错。如果世界模型可以稳定运行很长时间，机器人可以在虚拟环境里练习、模拟大量失败案例、提升策略学习效率。&lt;/p&gt;
&lt;p&gt;但要注意：ABot-World-0 目前主要突破的是视觉世界状态的长时稳定演化，距离&amp;quot;机器人可以依靠它学习复杂动作&amp;quot;还有距离。视觉演化与控制策略之间还需要打通。&lt;/p&gt;
&lt;h2 id="更准确的行业判断"&gt;更准确的行业判断&lt;/h2&gt;
&lt;p&gt;ABot-World-0 的意义不是&amp;quot;AI已经创造了真实世界模拟器&amp;quot;，而是：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;ABot-World-0 标志着交互式世界模型进一步从短时生成，走向长时间尺度运行。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这一步的重要性类似：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;图像生成 → 高质量图片&lt;/li&gt;
&lt;li&gt;视频生成 → 长视频&lt;/li&gt;
&lt;li&gt;世界模型 → 可持续运行的虚拟世界&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;它标志着世界模型竞争开始从&amp;quot;能不能生成一个世界&amp;quot;进入&amp;quot;这个世界能不能一直运行&amp;quot;。&lt;/p&gt;</description></item><item><title>从零搭建世界模型实验环境：MuJoCo + DreamerV3 实战指南</title><link>https://worldsensetech.com/zh/articles/world-model-lab-setup/</link><pubDate>Wed, 05 Aug 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/world-model-lab-setup/</guid><description>&lt;p&gt;前面写了好几篇世界模型的理论文章——从 RSSM 的数学原理到 Sim-to-Real 迁移，到 VLA 和世界模型的对比。有读者问：道理我都懂了，怎么动手跑起来？&lt;/p&gt;
&lt;p&gt;今天这篇就是回答这个问题的。我会手把手带你搭建一个完整的世界模型实验环境，从安装到训练到可视化，一步步走通。跑通之后，你就可以在这个基础上做自己的实验了。&lt;/p&gt;
&lt;p&gt;我们选用的工具链是：MuJoCo（物理仿真）+ DreamerV3（世界模型）。如果你需要更高保真度的渲染，后面可以替换为 Isaac Sim，但入门阶段 MuJoCo 足够了。&lt;/p&gt;
&lt;h2 id="工具选型为什么是这两个"&gt;工具选型：为什么是这两个&lt;/h2&gt;
&lt;p&gt;MuJoCo：目前机器人仿真领域最主流的引擎之一。物理精度高、API 简洁、速度快。2021 年被 DeepMind 收购后开源免费，现在是机器人学习研究的事实标准，也是连续控制世界模型研究中最常用的 benchmark 之一。&lt;/p&gt;
&lt;p&gt;DreamerV3：Danijar Hafner 等人开发的世界模型算法，是 Dreamer 系列的第三代。它用 RSSM（循环状态空间模型）学习环境动态，在想象空间中训练 Actor-Critic 策略。代码开源，文档清晰，是学习世界模型最好的起点。需要注意的是，DreamerV3 底层基于JAX + Haiku框架，而非 TensorFlow。&lt;/p&gt;
&lt;p&gt;日志格式说明：DreamerV3（commit e3f02248）输出自己的日志格式（&lt;code&gt;metrics.jsonl&lt;/code&gt; 和 &lt;code&gt;scores.jsonl&lt;/code&gt;），不使用 TensorBoard 的 event files。虽然名字里带&amp;quot;json&amp;quot;，但这是 JSON Lines 格式（每行一个 JSON 对象），可以用 Python 直接读取和可视化。本教程会教你如何用 Python 分析这些日志。&lt;/p&gt;
&lt;p&gt;如果你本地机器内存不足（低于 32GB），建议使用云端资源：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Google Colab：免费 GPU，内存约 12-25GB，适合快速验证。注意 Colab 的 session 有时长限制&lt;/li&gt;
&lt;li&gt;AutoDL / 矩池云：国内云平台，按小时计费，GPU 机型丰富&lt;/li&gt;
&lt;li&gt;AWS / GCP / Azure：按需启动 GPU 实例，适合长期实验&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;云端运行的好处是不受本地硬件限制，坏处是需要上传下载数据和模型。对于入门学习，Google Colab 是最经济的选择。&lt;/p&gt;</description></item><item><title>VLA vs 世界模型，谁主沉浮？</title><link>https://worldsensetech.com/zh/articles/vla-vs-world-model/</link><pubDate>Tue, 04 Aug 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/vla-vs-world-model/</guid><description>&lt;p&gt;2025年到2026年，机器人AI领域出现了两条截然不同的技术路线。一条是以RT-2、OpenVLA、π0为代表的VLA（Vision-Language-Action，视觉-语言-动作），另一条是以DreamerV3、Genie、DIAMOND为代表的世界模型（World Models）。&lt;/p&gt;
&lt;p&gt;很多同行问我：这两条路线，到底该押哪一边？我的回答是：这个问题本身就问错了。&lt;/p&gt;
&lt;p&gt;今天这篇文章，我想把这两条路线拆开来对比，讲清楚它们各自的逻辑、优势和瓶颈，最后聊聊为什么我认为它们最终会走向融合。&lt;/p&gt;
&lt;h2 id="两条路线的核心逻辑"&gt;两条路线的核心逻辑&lt;/h2&gt;
&lt;p&gt;先说VLA。&lt;/p&gt;
&lt;p&gt;VLA的思路很直接：把机器人的控制问题，变成一个&amp;quot;看图说话&amp;quot;问题。给模型一张摄像头的图片，再给它一句语言指令（比如&amp;quot;把红色杯子放到桌子上&amp;quot;），让它直接输出机器人关节应该怎么动。&lt;/p&gt;
&lt;p&gt;本质上，VLA是一个感知-决策的端到端映射。它不关心物理规律是什么，不关心动力学方程怎么解，它只关心一件事：给定当前看到的画面和语言指令，最优的动作是什么？&lt;/p&gt;
&lt;p&gt;这种方法的灵感来自大语言模型的成功。GPT能&amp;quot;看图说话&amp;quot;，那为什么不能让一个类似的模型&amp;quot;看图做动作&amp;quot;？RT-2（Google DeepMind，2023）第一次证明了这条路可行——它把机器人动作离散化成token，直接用Transformer来预测。从此，VLA成了一个热门方向。&lt;/p&gt;
&lt;p&gt;世界模型的思路完全不同。&lt;/p&gt;
&lt;p&gt;前面几篇文章我详细讲过，世界模型的核心是学习&amp;quot;如果我执行这个动作，环境会怎么变化&amp;quot;。它不是直接从观察映射到动作，而是先建立一个环境的&amp;quot;内部模拟器&amp;quot;，然后在这个模拟器中想象不同动作的后果，再选择最优的方案。&lt;/p&gt;
&lt;p&gt;打个比方：VLA像一个经验丰富的老司机，看到路况就直接打方向盘——靠的是大量驾驶数据训练出来的直觉。世界模型像一个谨慎的新手司机，每次变道前都会先在脑中模拟：&amp;ldquo;如果我变道，后面的车会怎么反应？安全吗？&amp;quot;——靠的是对物理世界的理解。&lt;/p&gt;
&lt;p&gt;一句话总结区别：VLA是&amp;quot;看到就做&amp;rdquo;，世界模型是&amp;quot;想了再做&amp;quot;。&lt;/p&gt;
&lt;h2 id="vla的优势和瓶颈"&gt;VLA的优势和瓶颈&lt;/h2&gt;
&lt;p&gt;VLA最大的优势是数据飞轮。&lt;/p&gt;
&lt;p&gt;互联网上有海量的视觉-语言数据（图片、视频、文本），这些数据都可以用来预训练VLA模型。然后再用少量的机器人操作数据做微调。这让VLA天然具备很强的泛化能力——它能理解没见过的物体，能遵循自然语言指令，甚至能做简单的推理。&lt;/p&gt;
&lt;p&gt;2025年涌现的几个代表性工作，把这种优势发挥到了极致：&lt;/p&gt;
&lt;p&gt;π0（Physical Intelligence，2024）：用flow matching生成连续动作序列，在折叠衣服、装洗碗机等复杂家务任务上表现出色。它证明了预训练VLA可以通过少量任务微调，快速适应新任务。&lt;/p&gt;
&lt;p&gt;OpenVLA（斯坦福/UC Berkeley，2024）：开源的VLA模型，基于Llama-2视觉语言模型微调，在Open X-Embodiment数据集上达到了不错的性能。开源让中小团队也能参与VLA研究。&lt;/p&gt;
&lt;p&gt;RT-2（Google DeepMind，2023）：最早把机器人动作变成token的工作，证明了55B参数的VLA可以zero-shot泛化到没见过的物体和指令。&lt;/p&gt;
&lt;p&gt;但VLA有一个根本性的瓶颈：缺乏长程规划能力。&lt;/p&gt;
&lt;p&gt;VLA的每一次决策都是&amp;quot;看到当前画面→输出动作&amp;quot;，它没有一个长期的&amp;quot;计划&amp;quot;。对于简单的单步任务（抓一个杯子），这没问题。但对于需要多步推理的复杂任务（&amp;ldquo;整理这个房间&amp;rdquo;——需要先收桌子、再扫地、再擦窗户），VLA就容易迷失方向。&lt;/p&gt;
&lt;p&gt;另一个问题是样本效率。VLA需要海量的机器人操作数据来微调。收集这些数据非常昂贵——每个任务都需要真实机器人反复执行，或者用仿真生成再迁移。对于中小团队来说，这是一个很高的门槛。&lt;/p&gt;
&lt;h2 id="世界模型的优势和瓶颈"&gt;世界模型的优势和瓶颈&lt;/h2&gt;
&lt;p&gt;世界模型最大的优势是样本效率和规划能力。&lt;/p&gt;
&lt;p&gt;因为世界模型学会了环境的动态规律，它可以在&amp;quot;想象&amp;quot;中生成大量的训练数据。一个训练好的世界模型，跑一天&amp;quot;想象&amp;quot;产生的数据量，可能超过真实机器人跑一个月。这大幅降低了对真实数据的依赖。&lt;/p&gt;
&lt;p&gt;DreamerV3已经证明了这一点：同一套参数，在55款Atari游戏上从零训练，只需要少量真实交互就能达到高水平表现。在机器人操控任务上，它的样本效率比传统RL高出10-100倍。&lt;/p&gt;
&lt;p&gt;规划能力是世界模型的另一张王牌。因为可以在想象中&amp;quot;预演&amp;quot;未来，世界模型天然适合做长程规划。比如一个机械臂要完成&amp;quot;打开抽屉→取出工具→拧螺丝&amp;quot;这样的多步任务，世界模型可以先在想象中模拟整个流程，找到最优的动作序列，再去执行。&lt;/p&gt;
&lt;p&gt;2025-2026年，世界模型方向也有几个重要进展：&lt;/p&gt;
&lt;p&gt;DIAMOND（2024）：用diffusion model做世界模型，在Atari上超越了DreamerV3的表现。证明了生成模型的范式也可以用于环境建模。&lt;/p&gt;
&lt;p&gt;Genie 2（Google DeepMind，2024）：从视频中学习交互式3D环境，可以从单张图片生成可交互的虚拟世界。虽然还不完美，但方向很有想象力。&lt;/p&gt;
&lt;p&gt;但世界模型也有明显的短板。&lt;/p&gt;
&lt;p&gt;第一是规模化困难。世界模型需要学习环境的动态规律，这意味着它必须对物理世界有很精确的理解。这比VLA的&amp;quot;模式匹配&amp;quot;要难得多。目前的世界模型大多还在实验室级别的简单任务上打转，离大规模应用还有距离。&lt;/p&gt;
&lt;p&gt;第二是语言接地弱。世界模型学习的是视觉-动作的映射，它不太理解自然语言指令。要让世界模型遵循&amp;quot;把红色的杯子放到蓝色的桌子上&amp;quot;这样的指令，需要额外的语言模块，目前还没有很好的解决方案。&lt;/p&gt;
&lt;p&gt;第三是长期预测的误差累积。世界模型在想象中预测越远的未来，误差越大。这限制了它的规划深度——通常只能可靠地预测未来几十步，对于需要上百步的复杂任务，规划质量会明显下降。&lt;/p&gt;
&lt;h2 id="对比一张表看清差异"&gt;对比：一张表看清差异&lt;/h2&gt;
&lt;p&gt;把两条路线放在一起对比：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;维度&lt;/th&gt;
					&lt;th&gt;VLA&lt;/th&gt;
					&lt;th&gt;世界模型&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;核心思路&lt;/td&gt;
					&lt;td&gt;观察→动作的直接映射&lt;/td&gt;
					&lt;td&gt;学习环境动态，想象后行动&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;类比&lt;/td&gt;
					&lt;td&gt;直觉反应（老司机）&lt;/td&gt;
					&lt;td&gt;心理模拟（谨慎新手）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;数据需求&lt;/td&gt;
					&lt;td&gt;大量（需要海量操作数据）&lt;/td&gt;
					&lt;td&gt;较少（想象空间增强）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;泛化能力&lt;/td&gt;
					&lt;td&gt;强（语言接地，可zero-shot）&lt;/td&gt;
					&lt;td&gt;中（受限于训练环境分布）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;规划能力&lt;/td&gt;
					&lt;td&gt;弱（单步决策为主）&lt;/td&gt;
					&lt;td&gt;强（可多步想象推演）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;语言理解&lt;/td&gt;
					&lt;td&gt;强（天然支持语言指令）&lt;/td&gt;
					&lt;td&gt;弱（需要额外模块）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;规模化&lt;/td&gt;
					&lt;td&gt;容易（可复用LLM基础设施）&lt;/td&gt;
					&lt;td&gt;困难（环境建模复杂度高）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;代表工作&lt;/td&gt;
					&lt;td&gt;RT-2, π0, OpenVLA&lt;/td&gt;
					&lt;td&gt;DreamerV3, DIAMOND, Genie 2&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;看完这张表，你可能觉得VLA全面占优。短期来看确实如此——VLA更容易工程化，更容易拿到融资，也更容易做出demo。但世界模型在样本效率和规划能力上的优势，是VLA短期内很难弥补的。&lt;/p&gt;</description></item><item><title>2026年，「世界模型」会是下一个AI风口么？</title><link>https://worldsensetech.com/zh/articles/world-model-2026-trend/</link><pubDate>Mon, 03 Aug 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/world-model-2026-trend/</guid><description>&lt;p&gt;先说结论：是世界模型的风口，但不是所有人的风口。&lt;/p&gt;
&lt;p&gt;2025-2026年，世界模型确实热起来了。Sora、Kling、Vidu这些视频生成模型本质上都在学&amp;quot;世界怎么变化&amp;quot;；DreamerV3在机器人控制上证明了世界模型的样本效率优势；2026年中科院的综述把四大技术范式梳理清楚，标志着这个方向从&amp;quot;散兵游勇&amp;quot;进入&amp;quot;体系化&amp;quot;阶段。&lt;/p&gt;
&lt;p&gt;但&amp;quot;风口&amp;quot;这个词需要拆开看。我分三个层面聊。&lt;/p&gt;
&lt;h2 id="技术层面确实在爆发"&gt;技术层面：确实在爆发&lt;/h2&gt;
&lt;p&gt;几个信号很明确：&lt;/p&gt;
&lt;p&gt;论文数量翻倍。2024-2025年世界模型相关的顶会论文比前两年翻了一倍多，四大范式（观测级生成、隐空间建模、强化学习驱动、对象中心表示）已经成型。&lt;/p&gt;
&lt;p&gt;大厂入场。DeepMind、OpenAI、Meta都在布局。OpenAI的Sora虽然定位是视频生成，但技术路线和世界模型高度重合。Meta的V-JEPA系列在隐空间世界模型上走得很快。&lt;/p&gt;
&lt;p&gt;应用场景拓宽。从最早的游戏仿真，扩展到机器人操控、自动驾驶决策、科学发现模拟、GUI智能体。每个场景都在催生新的技术需求。&lt;/p&gt;
&lt;p&gt;从技术成熟度曲线看，世界模型大概在&amp;quot;期望膨胀期&amp;quot;的早期阶段——技术有真实价值，但市场预期可能跑在了实际能力前面。&lt;/p&gt;
&lt;h2 id="产业层面离大规模商业化还有距离"&gt;产业层面：离大规模商业化还有距离&lt;/h2&gt;
&lt;p&gt;这是需要冷静看待的部分。&lt;/p&gt;
&lt;p&gt;Sim-to-Real还没解决。世界模型在仿真里很强，但部署到真实机器人上性能下降30-50%。这个瓶颈八年没突破，短期内也难有根本性解决方案。&lt;/p&gt;
&lt;p&gt;计算成本太高。训练一个像样的世界模型需要多张A100跑几周。对于创业公司或个人研究者，这个门槛不低。&lt;/p&gt;
&lt;p&gt;杀手级应用还没出现。大语言模型有ChatGPT，图像生成有Midjourney，世界模型的&amp;quot;ChatGPT时刻&amp;quot;还没到来。目前最接近的是机器人操控，但离消费级产品还有距离。&lt;/p&gt;
&lt;p&gt;所以从产业角度，世界模型更像是&amp;quot;2-3年后的风口&amp;quot;，不是&amp;quot;现在就能变现的风口&amp;quot;。&lt;/p&gt;
&lt;h2 id="个人层面谁适合现在入场"&gt;个人层面：谁适合现在入场&lt;/h2&gt;
&lt;p&gt;基于我自己的观察和实践，分几种情况：&lt;/p&gt;
&lt;p&gt;适合入场的：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;做研究、读博、进大厂AI Lab的人——这是具身智能的核心技术，未来5-10年有持续需求&lt;/li&gt;
&lt;li&gt;有机器人/自动化背景的工程师——世界模型的应用层（任务适配、迁移工具链）离钱更近，大厂还没完全覆盖&lt;/li&gt;
&lt;li&gt;有算力资源的团队——能跑得起训练，有机会做出有影响力的工作&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;需要谨慎的：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;想快速变现的创业者——这个方向太慢，不适合追求短期回报&lt;/li&gt;
&lt;li&gt;纯软件背景、没有物理世界经验的人——世界模型的核心难点在Sim-to-Real，需要懂机器人、懂控制、懂硬件&lt;/li&gt;
&lt;li&gt;算力有限的个人研究者——可以学原理、跑开源代码，但想做出原创贡献很难&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="我的判断"&gt;我的判断&lt;/h2&gt;
&lt;p&gt;世界模型是AI从&amp;quot;理解语言&amp;quot;走向&amp;quot;理解世界&amp;quot;的关键一步。这个方向的价值是确定的，但时间线可能比大多数人预期的要长。&lt;/p&gt;
&lt;p&gt;短期（1-2年）：技术继续突破，但商业化案例有限，主要是大厂和研究机构在推进。&lt;/p&gt;
&lt;p&gt;中期（3-5年）：Sim-to-Real问题部分解决，工业场景（机器人装配、仓储物流）开始出现规模化应用。&lt;/p&gt;
&lt;p&gt;长期（5-10年）：如果&amp;quot;统计拟合→机理理解&amp;quot;这个关口能突破，世界模型可能成为通用人工智能的基石。&lt;/p&gt;
&lt;p&gt;对于个人来说，现在入场不晚，但需要耐心。不要指望半年就能看到回报，给自己至少2-3年的时间。&lt;/p&gt;</description></item><item><title>回看世界模型8年进展，始终没突破的瓶颈是什么？</title><link>https://worldsensetech.com/zh/articles/world-model-8year-bottleneck/</link><pubDate>Mon, 03 Aug 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/world-model-8year-bottleneck/</guid><description>&lt;p&gt;做世界模型方向大半年，最大的感受是：论文很多，但真正能落地的很少。最近读了一篇2026年中科院联合多所高校的综述，把八年来的进展梳理得很清楚。我结合自己的实践，聊聊几个始终没突破的瓶颈。&lt;/p&gt;
&lt;p&gt;先说进步。从2018年Ha和Schmidhuber提出世界模型概念，到DreamerV3在55款Atari游戏上统一参数跑出好成绩，再到Sora等视频生成模型的爆发，世界模型确实从&amp;quot;概念验证&amp;quot;走到了&amp;quot;技术验证&amp;quot;阶段。四大技术范式（观测级生成、隐空间建模、强化学习驱动、对象中心表示）已经成型，应用场景也从游戏扩展到了机器人、自动驾驶、科学发现等领域。&lt;/p&gt;
&lt;p&gt;但有几个核心瓶颈，八年过去了，依然没有根本性突破。&lt;/p&gt;
&lt;h2 id="瓶颈一sim-to-real鸿沟"&gt;瓶颈一：Sim-to-Real鸿沟&lt;/h2&gt;
&lt;p&gt;这是最痛的瓶颈。世界模型在仿真环境里表现很好，DreamerV3的样本效率比传统RL高出10-100倍。但仿真里训练的策略，部署到真实机器人上往往性能下降30-50%。&lt;/p&gt;
&lt;p&gt;域随机化能缓解一部分问题，但远没有解决。根本原因在于：仿真器无法完美模拟真实世界的物理动态——接触摩擦、柔性形变、传感噪声、未建模的干扰。世界模型学到的&amp;quot;世界规律&amp;quot;是仿真世界的规律，不是真实世界的。&lt;/p&gt;
&lt;p&gt;八年了，这个问题依然没有优雅的解决方案。要么花大量时间做系统辨识，要么接受性能打折。&lt;/p&gt;
&lt;h2 id="瓶颈二长程预测误差累积"&gt;瓶颈二：长程预测误差累积&lt;/h2&gt;
&lt;p&gt;世界模型的核心能力是&amp;quot;在想象中推演未来&amp;quot;。但预测不可能完美，每一步都有小误差，多步之后误差指数级放大。&lt;/p&gt;
&lt;p&gt;DreamerV3的想象步数限制在15步左右，超过这个长度预测就不可靠了。对于需要长期规划的任务（比如机器人完成一个多步骤的装配任务），15步远远不够。&lt;/p&gt;
&lt;p&gt;层级时序建模、显式因果表征这些方向有潜力，但目前都还在研究阶段，没有成熟的工程方案。&lt;/p&gt;
&lt;h2 id="瓶颈三物理一致性"&gt;瓶颈三：物理一致性&lt;/h2&gt;
&lt;p&gt;现在的模型能生成看起来很合理的画面，但经常违反物理定律。比如生成的视频里物体穿模了、重力方向不对、碰撞后动量不守恒。&lt;/p&gt;
&lt;p&gt;这是因为模型学的是数据分布的统计规律，不是物理定律。它知道&amp;quot;杯子掉在地上会碎&amp;quot;是因为训练数据里见过，而不是因为它理解了重力和材料力学。&lt;/p&gt;
&lt;p&gt;把物理约束（能量守恒、动量守恒、因果规则）嵌入模型是一个方向，但怎么嵌入、嵌入多少、会不会限制模型的表达能力，这些问题还没有共识。&lt;/p&gt;
&lt;h2 id="瓶颈四计算成本"&gt;瓶颈四：计算成本&lt;/h2&gt;
&lt;p&gt;训练一个像样的世界模型，需要多张A100跑几天到几周。推理时虽然比训练快，但对于实时控制场景（比如机器人每秒需要决策100次），延迟仍然太高。&lt;/p&gt;
&lt;p&gt;边缘设备部署更是难上加难。工业场景的机器人控制器算力有限，跑不动大模型。模型压缩、知识蒸馏这些方法能用，但会牺牲预测精度。&lt;/p&gt;
&lt;h2 id="为什么这些瓶颈难突破"&gt;为什么这些瓶颈难突破&lt;/h2&gt;
&lt;p&gt;根本原因在于：世界模型试图用数据驱动的方法解决一个需要机理理解的问题。&lt;/p&gt;
&lt;p&gt;人类理解世界靠的不只是观察统计，还有物理直觉、因果推理、抽象建模。现在的模型只有第一种能力，缺后两种。&lt;/p&gt;
&lt;p&gt;未来5年，如果能突破&amp;quot;统计拟合→机理理解&amp;quot;这个关口，世界模型才能真正成为通用人工智能和具身智能的基石。否则，它可能一直停留在*&amp;ldquo;仿真里很强，真实世界拉胯&amp;rdquo;*的状态。&lt;/p&gt;</description></item><item><title>世界模型（world model）当下是一个好的方向吗？</title><link>https://worldsensetech.com/zh/articles/world-model-good-direction/</link><pubDate>Mon, 03 Aug 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/world-model-good-direction/</guid><description>&lt;p&gt;作为一个在这个方向上摸爬滚打了大半年的工程师，说说我的看法。&lt;/p&gt;
&lt;p&gt;先说结论：是好方向，但不是所有人都适合现在入场。&lt;/p&gt;
&lt;h2 id="为什么是好方向"&gt;为什么是好方向&lt;/h2&gt;
&lt;p&gt;世界模型解决的是一个很根本的问题：让AI不只是&amp;quot;看到&amp;quot;世界，而是&amp;quot;理解&amp;quot;世界。&lt;/p&gt;
&lt;p&gt;大语言模型已经证明了，当模型足够大、数据足够多时，它能涌现出很强的能力。但语言模型理解的是文本世界，不是物理世界。机器人要真正在现实环境中工作，需要理解物理规律——重力、摩擦力、碰撞、因果。这些东西光靠文本数据学不到。&lt;/p&gt;
&lt;p&gt;世界模型的核心思想很直觉：让模型学习*&amp;ldquo;如果我执行这个动作，环境会怎么变化&amp;rdquo;。学会了这个，机器人就可以在&amp;quot;想象&amp;quot;中训练策略，而不是在真实世界里反复试错。这对机器人来说意义重大——真实世界的试错成本高、速度慢、还可能损坏硬件。&lt;/p&gt;
&lt;p&gt;DreamerV3（2023年，Danijar Hafner等）已经证明了这条路可行。同一套参数，在55款Atari游戏上都能跑出不错的成绩，在机器人操控任务上样本效率比传统RL高出10-100倍。&lt;/p&gt;
&lt;p&gt;2024-2025年，世界模型在视频生成领域也爆发了。Sora、Kling、Vidu这些视频生成模型，本质上也是在学&amp;quot;世界会怎么变化&amp;quot;。虽然它们目前还停留在视觉层面，没有和物理控制打通，但方向是一致的。&lt;/p&gt;
&lt;h2 id="但为什么不是所有人都适合入场"&gt;但为什么不是所有人都适合入场&lt;/h2&gt;
&lt;h3 id="第一这个方向还在早期离大规模商业化有距离"&gt;第一，这个方向还在早期，离大规模商业化有距离&lt;/h3&gt;
&lt;p&gt;世界模型在仿真环境里表现很好，但Sim-to-Real迁移仍然是个大问题。仿真里训练的策略，部署到真实机器人上往往性能下降30-50%。域随机化、系统辨识这些方法能缓解，但远没有解决。如果你是想快速变现的创业者，这个方向可能太慢了。&lt;/p&gt;
&lt;h3 id="第二计算资源门槛不低"&gt;第二，计算资源门槛不低&lt;/h3&gt;
&lt;p&gt;训练一个像样的世界模型，至少需要多张A100跑几天到几周。不像写个Web应用，一台笔记本就能搞定。个人研究者或小团队需要精打细算。&lt;/p&gt;
&lt;h3 id="第三学术竞争很激烈"&gt;第三，学术竞争很激烈&lt;/h3&gt;
&lt;p&gt;这个方向的顶会论文主要来自Stanford、CMU、Berkeley、DeepMind等机构。如果你没有这些背景，纯靠自学想做出有影响力的工作，难度很大。&lt;/p&gt;
&lt;h2 id="我的建议"&gt;我的建议&lt;/h2&gt;
&lt;p&gt;如果你是想做研究、读博、进大厂AI Lab，世界模型绝对值得投入。它是具身智能的核心技术之一，未来5-10年都会有持续的研究需求。&lt;/p&gt;
&lt;p&gt;如果你是想创业或做产品，建议关注世界模型的应用层——比如用世界模型做工业机器人的快速任务适配、做仿真-to-现实的迁移工具链。这些方向离钱更近，而且大厂还没完全覆盖。&lt;/p&gt;
&lt;p&gt;如果你只是对技术感兴趣的工程师，我的建议是：先理解原理，跑通开源代码（DreamerV3有官方实现），然后在一个具体任务上实践。不需要从头训练一个大模型，学会用、学会改、学会部署，就已经很有价值了。&lt;/p&gt;
&lt;p&gt;我自己走的是最后这条路。不是学术大牛，也没有大厂的资源，就是一个对技术有热情的工程师。通过写博客、发文章来梳理自己的理解，同时也希望能帮到同样想进入这个方向的人。&lt;/p&gt;</description></item><item><title>RSSM状态空间模型详解：世界模型的核心引擎</title><link>https://worldsensetech.com/zh/articles/rssm-deep-dive/</link><pubDate>Sun, 02 Aug 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/rssm-deep-dive/</guid><description>&lt;p&gt;上一篇文章我们聊了世界模型的基本概念和DreamerV3的整体架构。有读者反馈说，想更深入地了解RSSM到底是怎么工作的。这篇文章就来拆解这个Dreamer系列世界模型的核心组件。&lt;/p&gt;
&lt;p&gt;我会尽量把数学讲清楚，但不会过度形式化。毕竟我们的目标是理解原理，而不是证明定理。&lt;/p&gt;
&lt;h2 id="为什么需要状态空间模型"&gt;为什么需要状态空间模型&lt;/h2&gt;
&lt;p&gt;在讨论RSSM之前，先退一步想想：为什么我们需要状态空间模型？直接用RNN或者Transformer不行吗？&lt;/p&gt;
&lt;p&gt;先说RNN。传统RNN的问题在于，它把所有信息压缩到一个确定性的隐状态向量里。这就像让你用一个数字来描述&amp;quot;今天天气怎么样&amp;quot;——不管你怎么选这个数字，都会丢失大量信息。更关键的是，RNN没有表达不确定性的能力。如果环境有随机因素（比如一阵风吹来），RNN无法表达&amp;quot;我不确定接下来会发生什么&amp;quot;。&lt;/p&gt;
&lt;p&gt;再说Transformer。Transformer的注意力机制确实强大，但它有两个问题：一是计算复杂度随序列长度平方增长，对于需要长程记忆的机器人任务来说成本太高；二是它本质上是一个开环模型，没有显式的状态转移结构，不太适合做控制。&lt;/p&gt;
&lt;p&gt;状态空间模型（SSM）是一个折中方案。它有显式的状态转移方程，能捕捉动态系统的本质；同时通过精心设计的状态表示，在表达能力和计算效率之间取得平衡。&lt;/p&gt;
&lt;h2 id="rssm的核心思想双轨状态"&gt;RSSM的核心思想：双轨状态&lt;/h2&gt;
&lt;p&gt;RSSM的全称是Recurrent State-Space Model，循环状态空间模型。它的核心创新在于把隐状态拆成了两条轨道：&lt;/p&gt;
&lt;p&gt;确定性状态 hₜ（Deterministic State）&lt;/p&gt;
&lt;p&gt;这个状态类似于传统RNN的隐状态，通过一个GRU（门控循环单元）更新：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-fallback" data-lang="fallback"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;`hₜ = GRU(hₜ₋₁, zₜ₋₁, aₜ₋₁)`
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;它捕捉的是环境中的确定性规律——那些可以精确预测的部分。比如&amp;quot;如果机械臂向右移动10厘米，末端执行器的x坐标就增加10厘米&amp;quot;这种确定的物理关系。&lt;/p&gt;
&lt;p&gt;随机性状态 zₜ（Stochastic State）&lt;/p&gt;
&lt;p&gt;这个状态是从一个分布中采样得到的：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-fallback" data-lang="fallback"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;`zₜ ~ p(zₜ | hₜ) # 先验（想象时）
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;zₜ ~ q(zₜ | hₜ, oₜ) # 后验（训练时）`
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;它捕捉的是环境中的不确定性——那些无法精确预测的部分。比如&amp;quot;两个表面之间的摩擦力可能在0.2到0.4之间&amp;quot;这种模糊的物理特性。&lt;/p&gt;
&lt;p&gt;为什么要这样拆分？因为真实世界就是由确定性规律和不确定性因素共同构成的。把它们分开建模，模型就能更准确地理解环境。&lt;/p&gt;
&lt;h2 id="完整的状态转移过程"&gt;完整的状态转移过程&lt;/h2&gt;
&lt;p&gt;让我们一步步走一遍RSSM的状态转移过程。假设在时刻t，我们有一个观测 oₜ（比如相机图像）和一个动作 aₜ（比如关节力矩）：&lt;/p&gt;
&lt;p&gt;第一步：更新确定性状态&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-fallback" data-lang="fallback"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;`hₜ = GRU(hₜ₋₁, zₜ₋₁, aₜ₋₁)`
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;把上一步的确定性状态hₜ₋₁、随机性状态zₜ₋₁和动作aₜ₋₁拼在一起，通过GRU得到新的确定性状态。这一步类似于传统RNN的更新。&lt;/p&gt;
&lt;p&gt;第二步：计算随机性状态&lt;/p&gt;
&lt;p&gt;这里有两种模式：&lt;/p&gt;
&lt;p&gt;训练时（有真实观测），我们用后验分布：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-fallback" data-lang="fallback"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;`μₜ, σₜ = Encoder(hₜ, oₜ)
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;zₜ = μₜ + σₜ * ε, 其中 ε ~ N(0, I)`
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;推理时（没有真实观测，在想象中），我们用先验分布：&lt;/p&gt;</description></item><item><title>什么是机器人世界模型？一个工程师的深度解读</title><link>https://worldsensetech.com/zh/articles/world-model-intro/</link><pubDate>Sat, 01 Aug 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/world-model-intro/</guid><description>&lt;p&gt;如果你关注AI领域的最新进展，可能已经注意到一个趋势：从ChatGPT到Sora，从AlphaFold到机器人操控，AI正在从&amp;quot;理解语言&amp;quot;走向&amp;quot;理解世界&amp;quot;。而在这个转变中，有一个概念越来越核心——世界模型（World Model）。&lt;/p&gt;
&lt;p&gt;今天这篇文章，我想从一个工程师的视角，聊聊什么是世界模型，为什么它对机器人如此重要，以及目前最有代表性的DreamerV3到底做了什么。&lt;/p&gt;
&lt;h2 id="一个直觉机器人也需要想象力"&gt;一个直觉：机器人也需要&amp;quot;想象力&amp;quot;&lt;/h2&gt;
&lt;p&gt;先做一个思想实验。&lt;/p&gt;
&lt;p&gt;想象你面前有一杯水，你伸手去推它。在你真正动手之前，你的大脑已经&amp;quot;模拟&amp;quot;了这个动作的后果——水会洒出来，杯子会滑动，你的手会变湿。你没有真正去做，但你已经&amp;quot;知道&amp;quot;了结果。&lt;/p&gt;
&lt;p&gt;这种能力，心理学家称之为&amp;quot;心智模拟&amp;quot;（Mental Simulation）。它是人类智能的核心能力之一。我们不需要每次都通过试错来学习，而是可以在脑海中&amp;quot;想象&amp;quot;行动的后果，然后选择最优的方案。&lt;/p&gt;
&lt;p&gt;传统的机器人是怎么做的呢？大多数时候，它们靠的是试错。强化学习（Reinforcement Learning）的基本逻辑就是：在环境中执行动作，观察结果，获得奖励或惩罚，然后更新策略。这就像一个蒙着眼睛的人在迷宫里乱走，靠碰壁来学习地图。&lt;/p&gt;
&lt;p&gt;问题很明显：效率太低了。一个真实的机械臂，每次试错都要消耗时间、磨损硬件，还可能造成损坏。如果机器人能像人一样，先在&amp;quot;脑海&amp;quot;中模拟一下，再决定怎么做，那效率会有质的飞跃。&lt;/p&gt;
&lt;p&gt;世界模型，就是机器人的&amp;quot;想象力&amp;quot;。&lt;/p&gt;
&lt;h2 id="世界模型到底在做什么"&gt;世界模型到底在做什么&lt;/h2&gt;
&lt;p&gt;用一句话概括：世界模型学习的是&amp;quot;如果我执行某个动作，环境会怎么变化&amp;quot;。&lt;/p&gt;
&lt;p&gt;技术上说，世界模型是一个环境的内部模拟器。它接收当前的状态和要执行的动作作为输入，输出预测的下一个状态和可能获得的奖励。形式化地表示：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-fallback" data-lang="fallback"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;`下一个状态 = 世界模型(当前状态, 动作)
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;预测奖励 = 奖励函数(当前状态, 动作)`
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;这看起来很简单，但它的能力取决于模型学到了多好的环境动态。一个好的世界模型，能够准确预测几百步甚至上千步之后的环境状态。&lt;/p&gt;
&lt;p&gt;有了世界模型之后，策略训练就变成了一个完全不同的游戏。机器人不需要在真实环境中试错，而是在世界模型构建的&amp;quot;想象空间&amp;quot;中训练。就像下棋的高手，不需要真的走每一步，而是在脑海中推演多种可能的走法，然后选择最优的。&lt;/p&gt;
&lt;h2 id="dreamerv3当前最强的世界模型之一"&gt;DreamerV3：当前最强的世界模型之一&lt;/h2&gt;
&lt;p&gt;说到世界模型在机器人领域的应用，就不得不提Dreamer系列。这是Danijar Hafner等人从2020年开始持续迭代的工作，到2023年的DreamerV3已经在多个基准测试上达到了SOTA。&lt;/p&gt;
&lt;p&gt;DreamerV3的核心架构有三个关键组件：&lt;/p&gt;
&lt;h3 id="1-rssm循环状态空间模型"&gt;1. RSSM：循环状态空间模型&lt;/h3&gt;
&lt;p&gt;RSSM（Recurrent State-Space Model）是世界模型的&amp;quot;记忆体&amp;quot;。它维护两种状态：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;确定性状态 hₜ：捕捉环境的长期趋势和规律，比如&amp;quot;物体A在桌子左边&amp;quot;这种相对稳定的信息。&lt;/li&gt;
&lt;li&gt;随机性状态 zₜ：捕捉环境的即时不确定性，比如&amp;quot;物体A的精确位置可能有几毫米的偏差&amp;quot;。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;为什么需要两种状态？因为真实世界既有确定性的一面（物理规律），也有不确定性的一面（传感噪声、未建模的动态）。传统的RNN只有一种隐状态，很难同时处理这两种特性。RSSM通过双轨设计，让模型既能记住长期规律，又能表达短期不确定性。&lt;/p&gt;
&lt;h3 id="2-actor-critic在想象中训练策略"&gt;2. Actor-Critic：在想象中训练策略&lt;/h3&gt;
&lt;p&gt;有了世界模型之后，怎么训练机器人的行为策略？DreamerV3用的是Actor-Critic方法：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Actor（演员）：负责选择动作。给定当前状态，输出一个动作分布。&lt;/li&gt;
&lt;li&gt;Critic（评论家）：负责评估。给定当前状态，预测未来能获得的累计奖励。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;关键创新在于：Actor和Critic的训练完全在想象空间中进行。从经验回放池中采样起始状态，然后用世界模型&amp;quot;展开&amp;quot;一条轨迹（默认15步），在这条想象的轨迹上计算损失并更新网络。&lt;/p&gt;
&lt;p&gt;这意味着什么？意味着机器人可以在&amp;quot;梦&amp;quot;中练习几百万次，而不需要动一下真实的硬件。&lt;/p&gt;
&lt;h3 id="3-对称对数损失让训练更稳定"&gt;3. 对称对数损失：让训练更稳定&lt;/h3&gt;
&lt;p&gt;DreamerV3相比前代最大的改进之一，是引入了对称对数（symlog）变换来处理奖励和价值的尺度问题。&lt;/p&gt;
&lt;p&gt;不同任务的奖励尺度可能差异巨大——有的任务奖励是0到1，有的是0到10000。传统方法需要对每个任务手动缩放奖励，这很不优雅。DreamerV3通过对称对数变换，自动将任意尺度的奖励压缩到一个合理范围内，实现了真正的&amp;quot;一个算法跑所有任务&amp;quot;。&lt;/p&gt;
&lt;h2 id="与传统强化学习的本质区别"&gt;与传统强化学习的本质区别&lt;/h2&gt;
&lt;p&gt;很多人会问：这不就是强化学习吗？有什么区别？&lt;/p&gt;
&lt;p&gt;区别在于样本效率。&lt;/p&gt;
&lt;p&gt;传统的强化学习（比如PPO、SAC）是无模型（model-free）的。它们直接从环境交互中学习策略，不需要理解环境的动态。这就像一个人通过不断试错来学骑自行车——摔了很多次之后，身体&amp;quot;记住&amp;quot;了怎么保持平衡。&lt;/p&gt;
&lt;p&gt;世界模型方法是有模型（model-based）的。它先学习环境的动态模型，然后在模型中训练策略。这更像一个人先理解自行车的物理原理（重心、角动量、转向几何），然后在脑海中模拟骑行的过程，最后再实际上车。&lt;/p&gt;
&lt;p&gt;在实际效果上，DreamerV3的样本效率通常比PPO高出10到100倍。也就是说，达到同样的性能，DreamerV3可能只需要真实环境交互10万步，而PPO需要1000万步。对于机器人来说，这意味着训练时间从几周缩短到几小时。&lt;/p&gt;
&lt;h2 id="应用场景不只是游戏"&gt;应用场景：不只是游戏&lt;/h2&gt;
&lt;p&gt;DreamerV3最初在Atari游戏上展示了惊人的能力——用同一套超参数，在55款游戏中都取得了不错的成绩。但它的能力远不止于此。&lt;/p&gt;
&lt;p&gt;在机器人领域，世界模型已经开始在以下场景中展现价值：&lt;/p&gt;
&lt;p&gt;工业装配：机器人需要学会将不同形状的零件装配到产品上。传统方法需要为每种零件编写专门的程序，而世界模型方法可以通过想象训练快速适配新零件。&lt;/p&gt;
&lt;p&gt;灵巧操作：比如翻转物体、拧瓶盖、系鞋带等需要精细力控的任务。这些任务在仿真中很难精确建模，世界模型可以从少量真实数据中学习到复杂的接触动态。&lt;/p&gt;
&lt;p&gt;导航与探索：在未知环境中规划路径。世界模型可以预测&amp;quot;如果我往那边走，会看到什么&amp;quot;，从而做出更好的探索决策。&lt;/p&gt;
&lt;h2 id="局限性与未来"&gt;局限性与未来&lt;/h2&gt;
&lt;p&gt;当然，世界模型不是万能的。它目前面临几个主要挑战：&lt;/p&gt;
&lt;p&gt;长程预测误差累积：世界模型的预测不可能完美，每一步都有小误差，多步之后误差会指数级放大。目前DreamerV3的想象步数限制在15步左右，更长的预测会变得不可靠。&lt;/p&gt;
&lt;p&gt;复杂物理场景：对于涉及流体、软体、复杂接触的场景，世界模型的预测精度还不够高。比如抓取一块布料，布料的形变很难准确预测。&lt;/p&gt;
&lt;p&gt;计算成本：训练一个高质量的世界模型需要大量的计算资源。虽然推理时很高效，但训练阶段并不便宜。&lt;/p&gt;
&lt;p&gt;这些挑战也是当前研究的前沿方向。我相信在未来2-3年内，随着模型架构的改进和计算效率的提升，世界模型会在更多真实机器人场景中落地。&lt;/p&gt;
&lt;h2 id="写在最后"&gt;写在最后&lt;/h2&gt;
&lt;p&gt;世界模型的核心思想其实很朴素：先理解世界，再决定行动。这和人类的学习方式是一致的。我们不会一开始就盲目尝试，而是先观察、理解、预测，然后才采取行动。&lt;/p&gt;</description></item></channel></rss>