WorldSense 技术笔记

从 Dreamer 到世界模型智能体:未来方向与研究趋势

2026年8月31日 · 阅读约37分钟 · DreamerV3, 世界模型, Transformer, V-JEPA, Genie, LLM Agent, Dreamer系列
目录

Dreamer 系列 · 第 6 篇

系列目录(当前在第 6 篇):

  1. (一)读懂 Dreamer:世界模型是怎么学会’想象’的?
  2. (二)Dreamer 的 Actor-Critic:想象空间里的策略优化
  3. (三)DreamerV3 训练工程实践:从 GPU 配置到超参调优
  4. (四)DreamerV3 GPU 选型指南:从显存需求到性价比分析
  5. (五)Dreamer 的应用实践:从仿真控制到 Sim-to-Real
  6. (六)从 Dreamer 到世界模型智能体:未来方向与研究趋势

前面五篇文章从架构、原理、训练、硬件到应用,把 Dreamer 系列讲了一遍。但一个更宏观的问题是:世界模型的未来在哪里?Dreamer 类方法会如何演进?

这篇文章作为 Dreamer 系列的收官篇,从 Dreamer 出发,展望世界模型的几个重要研究方向:Transformer 世界模型、视觉预测模型(V-JEPA/Genie)、World Model + LLM Agent、以及机器人基础模型。

世界模型的三个层次

在展开讨论之前,有必要先澄清"世界模型"这个概念。后文会涉及多种不同的方法,它们实际上处于世界模型的不同层次:

层次目标代表
表征世界模型 (Representation WM)学习有用的世界表征V-JEPA、Slot Attention
动力学世界模型 (Dynamics WM)学习 state transition,服务于预测和决策Dreamer、MuZero
生成式世界模型 (Simulation WM)生成可能的未来状态,支持多模态预测Genie、Diffusion WM
            World Model
                |
    ┌───────────┼───────────┐
    |           |           |
Representation Dynamics   Simulation
 (V-JEPA)     (Dreamer)    (Genie)
    |           |           |
 表征学习    策略优化     多未来生成

这三层不是竞争关系,而是互补的。Dreamer 属于动力学世界模型,V-JEPA 更接近表征层,Genie 和扩散模型属于生成层。理解这个分类,有助于避免把不同层次的方法混为一谈。

一、Dreamer 的局限与演进方向

在讨论未来之前,先回顾 Dreamer 的核心局限。前几篇文章中已经提到:

RSSM 的结构性限制

这些限制不是工程问题,而是架构层面的根本约束。RSSM 没有显式建模 3D 世界结构和因果关系,而是通过数据学习 action-conditioned latent dynamics。DreamerV3 通过 symlog、two-hot、KL balancing 等技巧把这套架构推到了很高的工程成熟度,但从研究角度看,RSSM 范式本身有它的天花板。

Dreamer 系列的演进逻辑

回顾 Dreamer 系列的发展:

可以看到,V1 到 V3 的演进主要集中在 latent dynamics、训练目标和优化稳定性的持续改进,而没有改变 RSSM + imagination + actor-critic 的整体范式。

Dreamer 的成功证明了"小规模、任务驱动的世界模型"可行,但并没有证明"通用世界模型"已经解决。从 task-specific world model 到 general world model 之间的跨度,正是后文讨论的各个方向试图填补的。

值得一提的是,Dreamer 之外还有另一条重要的世界模型路线:MuZero。其重点不是生成逼真的世界表征,而是在任务相关空间中学习用于规划的抽象模型——通过 learned dynamics + MCTS 实现规划,在 Atari 和 Go 等任务上取得了突出成绩。

两者代表了不同的世界模型哲学:

Dreamer(representation-oriented):
学习世界模型 → 产生 imagined trajectories → 优化策略

MuZero(decision-oriented):
学习任务相关 dynamics → 搜索未来动作 → 选择决策

前者强调"想象学习",后者强调"模型辅助规划"。Dreamer 追求学到"像真实世界"的表征,MuZero 只关心"能帮我做出好决策"的抽象模型——不要求表征逼真,只要求预测有用。

那么,架构层面的突破会来自哪里?

二、Transformer 世界模型

从 RSSM 到 Attention

RSSM 使用 GRU 作为 deterministic model,这是一种序列到序列的递归结构。但近年来,Transformer 在序列建模上的成功引发了一个自然的问题:能不能用 Transformer 替代 RSSM?

实际上已经有相关工作:

Transformer 世界模型的优势:

需要注意的是,Transformer 的优势主要来自序列建模能力和规模化训练能力,而不是天然更适合作为动力学模型。它和 RSSM、JEPA、Diffusion 是不同维度的探索,而非简单替代关系。

但 Transformer 世界模型也面临挑战:

需要注意的是,世界模型需要的不只是更长的 context,而是更好的状态压缩和长期记忆机制。语言模型处理的是离散 token 序列,而世界面对的是连续演化的系统——重力、质量、摩擦、几何关系这些物理量不会随时间消失。单纯增加 context length 不够,还需要 hierarchical latent model、recurrent memory、neural compression 等机制来实现有效的长期世界建模。

需要注意的是,目前 Transformer 世界模型并不是简单替代 RSSM,而是在探索不同的时序建模归纳偏置。一个可能的发展方向是混合架构:用 Transformer 处理长程依赖,用 RSSM 类结构处理时序动态。

另一个重要趋势是 tokenization。与 RSSM 直接在连续 latent space 建模不同,越来越多生成式世界模型选择先将视觉状态离散化为 token,再利用 Transformer 学习 token dynamics:

Observation → Tokenizer → Discrete tokens → Transformer dynamics → Future tokens

Genie、Sora 类路线的核心正是这种 tokenized world model。它使世界模型逐渐靠近语言模型的训练范式——用 next token prediction 的方式预测未来。这为 Dreamer → Genie → Sora → Agent 提供了一条技术演进线索。

大规模预训练的可能性

Transformer 的另一个优势是预训练。GPT、BERT 等模型的成功证明了"大规模预训练 + 微调"范式的威力。世界模型是否也能走这条路?

目前的探索:

但世界模型的预训练和语言模型有本质区别:

世界模型的预训练是一个有潜力的方向,但需要找到合适的表征方式和训练目标。直接套用语言模型的 pretrain-finetune 范式可能不够。

三、预测式世界模型与生成式世界模型

V-JEPA:预测式表征学习

Meta 的 V-JEPA (Visual Joint-Embedding Predictive Architecture) 代表了一种不同的思路——受世界模型思想影响的 predictive representation learning 方法:

V-JEPA 的核心思想:

输入:当前帧 + masked 未来帧
目标:预测 masked 区域的 latent representation

这和 Dreamer 的区别:

V-JEPA 代表了一个重要方向:世界模型不一定需要直接用于控制,可以作为通用的视觉表征学习框架。这种"表征优先"的思路可能更适合大规模预训练。因此 V-JEPA 更接近世界模型的感知层,而不是完整的 agent world model——它为智能体提供理解世界的能力,但不直接提供规划和决策能力。

值得一提的是,JEPA 系列不仅是视觉表征学习方法,也是 Yann LeCun 提出的 Advanced Machine Intelligence (AMI) 更大规模世界模型架构的一部分。AMI 路线的完整框架是 Perception → World Model → Cost/Planning → Action,和本文最后讨论的 Reasoning → World Model → Action 架构高度一致。

Genie:生成式交互环境模型

Google DeepMind 的 Genie 是另一个值得关注的方向:

Genie 的技术路线:

这和 Dreamer 的区别更明显:

Genie 类模型的价值不在于直接用于控制,而在于:

Genie 最大的突破不是视频生成能力,而是证明了互联网视频数据可能成为训练交互式世界模型的数据来源——无需动作标签,仅从未标注的视频中就能学到可交互的环境模型。这为未来大规模 world model pretraining 提供了一种可能路径。

但 Genie 面临一个根本性挑战:latent action discovery。互联网视频只有观测序列,没有控制信号——视频里"人开门"是观测,但"施加 20N 力、旋转 30 度"这些控制变量是缺失的。从无动作视频学习可控世界模型,需要从观察序列中反推出潜在控制变量。观测序列不等于控制轨迹,这是从视频学习交互式世界模型的核心难题。

但像素级生成的计算成本和预测误差仍然是根本挑战。

概率世界模型:从单一预测到多未来生成

与 Dreamer 的单步 latent prediction 不同,扩散世界模型 (Diffusion World Model) 通过学习未来状态分布,可以表示多个可能的未来,适合高不确定性环境的预测:

扩散世界模型的核心优势在于多模态未来预测

传统世界模型:
当前状态 → 预测单一未来

扩散世界模型:
当前状态 → 采样多个可能未来

真实世界存在高度不确定性——机器人推一个杯子,可能移动、可能翻倒、可能滑动。一个好的世界模型不仅需要预测"最可能发生什么",还需要表示"可能发生什么"。扩散模型天然适合建模这种多模态分布。

但扩散模型的计算成本显著高于 latent prediction 方法,如何平衡预测质量和推理效率仍是开放问题。

四、World Model + LLM Agent

大语言模型作为高层规划器

近年来,LLM 在推理和规划上展现了惊人的能力。一个自然的方向是:把 LLM 作为高层规划器,世界模型作为低层动态预测器

这种架构的思路:

用户指令
LLM (高层规划)
子目标序列
World Model (低层预测)
策略执行

优势:

已有的探索:

但这些工作大多没有显式的世界模型。如果把世界模型引入这个框架:

World Model + LLM 是一个有潜力的方向。LLM 的语义知识和世界模型的动力学预测能力结合,可能产生更强大的智能体。

随着推理型模型(Reasoning Model)的发展,未来架构可能不只是简单的 LLM + World Model,而是 Reasoning Model + World Model + Action Model 的三层结构:

Reasoning Model (推理 + 规划)
World Model (动力学预测 + 想象)
Action Model / VLA (策略执行)

大语言模型的发展方向之一,是从语言生成器逐渐演化为具备推理、规划和工具调用能力的认知模块。这种分层架构让每一层专注于不同层次的能力。

挑战与开放问题

但这个方向也面临挑战:

接口设计

LLM 输出的是文本或符号,世界模型需要的是连续的动作或目标。如何设计两者之间的接口?

接地问题 (Grounding)

LLM 的"常识"是从文本中学到的,可能和真实物理世界不一致。如何把 LLM 的规划和物理世界的约束对齐?

实时性

LLM 的推理速度相对较慢,如何和需要快速响应的控制系统结合?

这些问题没有标准答案,但研究方向是明确的:让语言模型理解物理,让世界模型理解语义

Belief State 与 Memory

在 LLM + World Model 的架构中,还有一个容易被忽略的关键环节:belief state。真实世界不是 fully observable 的——智能体看到的只是部分观测,需要维护一个内部信念状态:

Agent = Planner + World Model + Belief State

LLM (Planner)
goal
World Model (belief update)
policy

世界模型在这里的角色不只是"预测未来",还包括状态估计——根据新的观测不断更新内部信念。这和 POMDP(部分可观测马尔可夫决策过程)中的 belief update 是同一个问题。

此外,长期记忆 (Memory) 也是完整智能体架构中不可或缺的组件——智能体需要记住过去的经验,用于未来的决策。未来的世界模型可能需要和显式的记忆机制结合,而不是只依赖隐式的 recurrent state。

五、机器人基础模型

从专用到通用

目前的机器人学习大多是任务特定的:每个任务需要单独收集数据、训练策略。这种方式效率低,难以扩展。

一个更重要的方向是机器人基础模型 (Robotics Foundation Model)

世界模型在这个方向上的角色:

已有的探索

这些模型主要解决策略泛化问题,而不是完整世界建模问题。它们大多基于模仿学习或强化学习,世界模型的结合还处于早期阶段。

世界模型如何融入机器人基础模型

目前的机器人基础模型主要是 robot foundation policy——解决策略泛化问题。但完整的机器人智能体还需要预测能力:

Robot Foundation Model
        +
World Model (预测 dynamics)
Predictive Robot Agent

世界模型融入机器人基础模型的可能方式:

特别是 VLA 模型与世界模型的结合:

VLA Model (感知 + 语言理解 + 动作生成)
    +
World Model (动力学预测 + 可行性验证)
Predictive VLA Agent

VLA 模型擅长从多模态输入生成动作,但缺乏对未来动态的预测能力;世界模型恰好弥补这一点。两者的结合代表了从"反应式策略"到"预测式智能体"的演进。

这实际上引出了 Active World Model 的概念——未来机器人不只是 observe → act,而是:

observe
imagine futures(世界模型想象多个可能未来)
choose action(选择最优动作)
observe result(观察执行结果)
update model(更新世界模型)

这其实就是 Dreamer 的"想象训练"思想在真实机器人系统中的延伸——世界模型不再只是离线训练工具,而是运行时持续感知、预测、行动的认知核心。

World Model as Data Engine

未来机器人最关键的不只是"减少数据需求",而是形成自动数据闭环

Robot acts → collect experience → world model update → better policy → more capable robot → collect richer experience → ...

世界模型在这个闭环中的角色不只是 sample efficiency,而是作为 data engine

这种 self-improving loop 比单纯的样本效率更前沿——世界模型不只是"用更少的数据学习",而是"驱动数据自动增长"。

这个方向目前还处于早期,但代表了机器人基础模型从"策略泛化"到"预测+规划"的演进可能。

机器人基础模型很可能成为世界模型的重要应用方向之一。原因:

但挑战也很明显:

六、世界模型研究的几个趋势

综合以上讨论,世界模型研究有几个明显的趋势:

趋势一:从 RL 世界模型到通用世界模型

Dreamer 类方法属于 RL 世界模型——为强化学习服务,目标是提高样本效率。但世界模型的潜力远不止于此:

未来可能出现通用世界模型——不局限于 RL,而是作为通用的预测和规划工具。

趋势二:从单一模态到多模态融合

Dreamer 主要处理视觉和本体感知。但真实世界是多模态的:

未来的世界模型需要融合多模态信息,构建更完整的世界表征。

趋势三:从预测到生成

Dreamer 的想象空间是 latent space,预测的是 latent 动态。但 Genie 类模型展示了另一种可能:直接生成像素级未来

这两种路线各有优劣:

未来可能出现混合架构:在 latent space 做规划,在像素空间做验证。

趋势四:从单智能体到多智能体

Dreamer 主要处理单智能体任务。但真实世界是多智能体的:

未来的世界模型需要建模其他智能体的行为和意图,这是更复杂的挑战。

趋势五:从非结构化隐变量到结构化世界模型

Dreamer 的 latent state 是一个非结构化的向量——所有信息混合在一起。但真实世界的结构是物体 + 关系

非结构化表征:
pixels → latent vector(所有信息混合)

结构化表征:
pixels → objects → relations → dynamics

Object-centric World Model 是解决表征瓶颈的重要方向之一:

例如,机器人看到"桌子上一个杯子",结构化世界模型会分别建模杯子位置、质量、与手的关系,而不是把所有信息压缩成一个向量。这直接回应了前面提到的"没有显式 3D 结构"问题——通过 object-centric 表征,世界模型可以获得更结构化、更可解释的世界理解。

七、未来世界模型可能的融合方向

综合前面的讨论,未来世界模型的发展可能不是"Dreamer vs Genie vs LLM"的路线之争,而是多条路线的融合:

                 Human Goal
           Reasoning Model (推理 + 规划)
              ┌──────────┴──────────┐
              ↓                     ↓
          Memory              World Model
       (经验记忆)           (动力学预测)
              └──────────┬──────────┘
                   Belief State
                    (信念状态)
                     Planner
                    (决策优化)
                Policy / VLA Model
                      Action
                   Environment
                  New Experience
                    (→ Memory 更新)

这个框架的核心思想:

未来可能出现的不是单一的世界模型,而是模块化智能体架构——每个组件负责不同层次的能力,世界模型是其中的预测和规划核心。

这种融合架构面临的挑战:

但方向是明确的:从单一模型走向系统级的智能体架构

八、世界模型距离通用智能还有哪些挑战?

在讨论完未来方向之后,有必要澄清世界模型的当前边界。当前世界模型仍然面临:

这些限制意味着,世界模型距离 AGI 还有相当的距离。世界模型是通向更智能系统的重要组件,但不是唯一组件。它需要和感知、推理、规划、语言等其他能力结合,才能构建真正通用的智能体。

九、常见问题

Q1:Dreamer 和 ChatGPT 的世界模型有什么区别?

ChatGPT 类模型是通过大规模文本学习到的语言世界模型——它理解语言的统计规律,但不理解物理世界。Dreamer 的世界模型是通过环境交互学习到的动力学模型——它理解任务相关的动态变化,但不具备开放域语义知识。两者互补:一个擅长语义推理,一个擅长物理预测。

Q2:世界模型是不是 AGI 的必要条件?

世界模型可能是通向 AGI 的重要组件之一,但不是唯一组件。完整的通用智能还需要感知、推理、规划、语言、社交等多种能力。好的预测不等于好的决策,世界模型解决的是"预测未来"的问题,但 AGI 还需要"理解目标"和"价值对齐"。

Q3:为什么机器人需要世界模型?

机器人数据获取成本高、试错代价大。世界模型的核心价值是样本效率——通过在想象空间中反复练习,减少对真实交互的依赖。此外,世界模型可以在部署前预测动作后果,提供安全验证能力。

Q4:Genie 会取代 Dreamer 吗?

不太可能。Genie 和 Dreamer 解决的是不同层次的问题:Dreamer 学习的是 action-conditioned latent dynamics,直接服务于策略优化;Genie 学习的是视觉环境生成,更多用于数据增强和环境模拟。未来更可能是两者融合——用 Genie 类方法做感知层,用 Dreamer 类方法做决策层。

十、把之前的文章串起来

世界模型入门 → RSSM 深度解析 → RSSM 代码系列(6篇)
                              Dreamer 系列 #1:整体架构
                              Dreamer 系列 #2:Actor-Critic
                              Dreamer 系列 #3:训练技巧
                              Dreamer 系列 #4:GPU 选型
                              Dreamer 系列 #5:应用实践
                              Dreamer 系列 #6:未来方向(本篇)

未来方向是 Dreamer 系列的展望篇。从 Dreamer 的局限出发,探讨世界模型的演进方向和研究趋势。

如果你还没读过前面的文章,建议先看 Dreamer 整体架构Actor-Critic 详解训练技巧GPU 选型应用实践,再来读这篇未来方向,会更有收获。

十一、总结

回顾世界模型的发展脉络,一种可能的发展路线是:

2020-2024  RL World Model(Dreamer, MuZero)
                ↓ 表征学习 + 想象训练
2024-2026  Generative World Model(Genie, Diffusion WM)
                ↓ 多模态生成 + 不确定性建模
2026+      Agentic World Model(WM + Reasoning + VLA)
                ↓ 模块化智能体架构

从 Dreamer 到世界模型智能体,未来方向可以概括为:

Dreamer 不是世界模型的终点,而是一个重要的起点。它证明了学习到的世界模型可以用于有效的策略学习,这个核心思想会影响未来很多研究方向。

世界模型的研究才刚刚开始。未来几年,我们可能会看到更强大的世界模型出现,它们可能不再叫"Dreamer",但会继承 Dreamer 的核心思想:通过想象来学习

希望这个系列能帮你建立对世界模型的整体理解。如果有具体的研究问题,欢迎在评论区讨论。


← Dreamer 的应用实践:从仿真控制到 Sim-to-Real 世界模型 2026:从 Cosmos、Genie 到 JEPA 的路线分化 →

评论

W
侯晓琴

西北工业大学硕士,十余年自动化与 AI 工程经验。著有《Visual C++入门很容易》《C++程序设计经典300例》。目前聚焦世界模型与具身智能方向,记录从传统自动化到机器人 AI 的转型之路。