2025年到2026年,机器人AI领域出现了两条截然不同的技术路线。一条是以RT-2、OpenVLA、π0为代表的VLA(Vision-Language-Action,视觉-语言-动作),另一条是以DreamerV3、Genie、DIAMOND为代表的世界模型(World Models)。
很多同行问我:这两条路线,到底该押哪一边?我的回答是:这个问题本身就问错了。
今天这篇文章,我想把这两条路线拆开来对比,讲清楚它们各自的逻辑、优势和瓶颈,最后聊聊为什么我认为它们最终会走向融合。
两条路线的核心逻辑
先说VLA。
VLA的思路很直接:把机器人的控制问题,变成一个"看图说话"问题。给模型一张摄像头的图片,再给它一句语言指令(比如"把红色杯子放到桌子上"),让它直接输出机器人关节应该怎么动。
本质上,VLA是一个感知-决策的端到端映射。它不关心物理规律是什么,不关心动力学方程怎么解,它只关心一件事:给定当前看到的画面和语言指令,最优的动作是什么?
这种方法的灵感来自大语言模型的成功。GPT能"看图说话",那为什么不能让一个类似的模型"看图做动作"?RT-2(Google DeepMind,2023)第一次证明了这条路可行——它把机器人动作离散化成token,直接用Transformer来预测。从此,VLA成了一个热门方向。
世界模型的思路完全不同。
前面几篇文章我详细讲过,世界模型的核心是学习"如果我执行这个动作,环境会怎么变化"。它不是直接从观察映射到动作,而是先建立一个环境的"内部模拟器",然后在这个模拟器中想象不同动作的后果,再选择最优的方案。
打个比方:VLA像一个经验丰富的老司机,看到路况就直接打方向盘——靠的是大量驾驶数据训练出来的直觉。世界模型像一个谨慎的新手司机,每次变道前都会先在脑中模拟:“如果我变道,后面的车会怎么反应?安全吗?"——靠的是对物理世界的理解。
一句话总结区别:VLA是"看到就做”,世界模型是"想了再做"。
VLA的优势和瓶颈
VLA最大的优势是数据飞轮。
互联网上有海量的视觉-语言数据(图片、视频、文本),这些数据都可以用来预训练VLA模型。然后再用少量的机器人操作数据做微调。这让VLA天然具备很强的泛化能力——它能理解没见过的物体,能遵循自然语言指令,甚至能做简单的推理。
2025年涌现的几个代表性工作,把这种优势发挥到了极致:
π0(Physical Intelligence,2024):用flow matching生成连续动作序列,在折叠衣服、装洗碗机等复杂家务任务上表现出色。它证明了预训练VLA可以通过少量任务微调,快速适应新任务。
OpenVLA(斯坦福/UC Berkeley,2024):开源的VLA模型,基于Llama-2视觉语言模型微调,在Open X-Embodiment数据集上达到了不错的性能。开源让中小团队也能参与VLA研究。
RT-2(Google DeepMind,2023):最早把机器人动作变成token的工作,证明了55B参数的VLA可以zero-shot泛化到没见过的物体和指令。
但VLA有一个根本性的瓶颈:缺乏长程规划能力。
VLA的每一次决策都是"看到当前画面→输出动作",它没有一个长期的"计划"。对于简单的单步任务(抓一个杯子),这没问题。但对于需要多步推理的复杂任务(“整理这个房间”——需要先收桌子、再扫地、再擦窗户),VLA就容易迷失方向。
另一个问题是样本效率。VLA需要海量的机器人操作数据来微调。收集这些数据非常昂贵——每个任务都需要真实机器人反复执行,或者用仿真生成再迁移。对于中小团队来说,这是一个很高的门槛。
世界模型的优势和瓶颈
世界模型最大的优势是样本效率和规划能力。
因为世界模型学会了环境的动态规律,它可以在"想象"中生成大量的训练数据。一个训练好的世界模型,跑一天"想象"产生的数据量,可能超过真实机器人跑一个月。这大幅降低了对真实数据的依赖。
DreamerV3已经证明了这一点:同一套参数,在55款Atari游戏上从零训练,只需要少量真实交互就能达到高水平表现。在机器人操控任务上,它的样本效率比传统RL高出10-100倍。
规划能力是世界模型的另一张王牌。因为可以在想象中"预演"未来,世界模型天然适合做长程规划。比如一个机械臂要完成"打开抽屉→取出工具→拧螺丝"这样的多步任务,世界模型可以先在想象中模拟整个流程,找到最优的动作序列,再去执行。
2025-2026年,世界模型方向也有几个重要进展:
DIAMOND(2024):用diffusion model做世界模型,在Atari上超越了DreamerV3的表现。证明了生成模型的范式也可以用于环境建模。
Genie 2(Google DeepMind,2024):从视频中学习交互式3D环境,可以从单张图片生成可交互的虚拟世界。虽然还不完美,但方向很有想象力。
但世界模型也有明显的短板。
第一是规模化困难。世界模型需要学习环境的动态规律,这意味着它必须对物理世界有很精确的理解。这比VLA的"模式匹配"要难得多。目前的世界模型大多还在实验室级别的简单任务上打转,离大规模应用还有距离。
第二是语言接地弱。世界模型学习的是视觉-动作的映射,它不太理解自然语言指令。要让世界模型遵循"把红色的杯子放到蓝色的桌子上"这样的指令,需要额外的语言模块,目前还没有很好的解决方案。
第三是长期预测的误差累积。世界模型在想象中预测越远的未来,误差越大。这限制了它的规划深度——通常只能可靠地预测未来几十步,对于需要上百步的复杂任务,规划质量会明显下降。
对比:一张表看清差异
把两条路线放在一起对比:
| 维度 | VLA | 世界模型 |
|---|---|---|
| 核心思路 | 观察→动作的直接映射 | 学习环境动态,想象后行动 |
| 类比 | 直觉反应(老司机) | 心理模拟(谨慎新手) |
| 数据需求 | 大量(需要海量操作数据) | 较少(想象空间增强) |
| 泛化能力 | 强(语言接地,可zero-shot) | 中(受限于训练环境分布) |
| 规划能力 | 弱(单步决策为主) | 强(可多步想象推演) |
| 语言理解 | 强(天然支持语言指令) | 弱(需要额外模块) |
| 规模化 | 容易(可复用LLM基础设施) | 困难(环境建模复杂度高) |
| 代表工作 | RT-2, π0, OpenVLA | DreamerV3, DIAMOND, Genie 2 |
看完这张表,你可能觉得VLA全面占优。短期来看确实如此——VLA更容易工程化,更容易拿到融资,也更容易做出demo。但世界模型在样本效率和规划能力上的优势,是VLA短期内很难弥补的。
我的判断:不是谁替代谁,而是谁和谁结合
说了这么多对比,最后说说我自己的看法。
我认为VLA和世界模型不是竞争关系,而是互补关系。最终的方向,一定是两者的融合。
为什么?因为它们各自解决了对方最弱的那个环节。
VLA的优势是泛化和语言接地,但缺乏规划。世界模型的优势是规划和样本效率,但泛化和语言理解弱。如果把两者结合起来——用一个世界模型来做"想象"和规划,用一个VLA来做感知和语言理解——就能得到一个既有直觉又有深思熟虑的系统。
其实这个趋势已经出现了。
π0虽然被归类为VLA,但它用了flow matching来生成动作序列——这本质上就是一种"想象"。它不是简单地输出一个动作,而是生成一整个动作序列,然后在执行过程中不断修正。这已经有了世界模型的影子。
Genie 2虽然被归类为世界模型,但它从视频中学习的方式,和VLA从数据中学习感知-动作映射的方式非常相似。两者的技术边界正在模糊。
我自己的判断是:2026-2027年,我们会看到越来越多"VLA + 世界模型"的混合架构出现。具体来说,可能的架构是:
- 感知层:VLA负责视觉理解和语言接地,把摄像头画面和语言指令转化为结构化的任务表示
- 规划层:世界模型负责在想象空间中推演多个方案,选出最优的动作序列
- 执行层:VLA负责把规划层的抽象动作转化为具体的关节控制信号
这种"感知-规划-执行"的三层架构,既有人类认知的影子(系统1快思考 + 系统2慢思考),也有工程上的合理性。
对从业者的建议
如果你是想进入这个方向的工程师或研究生,我的建议是:不要只押一边。
学VLA,但也要理解世界模型的原理。学世界模型,但也要关注VLA的最新进展。两条路线的技术栈有大量重叠——Transformer架构、视觉编码器、强化学习基础——这些是通用的。
具体来说:
如果你偏工程,建议从VLA入手。OpenVLA是开源的,数据集是公开的,技术栈和LLM高度重合,更容易上手。先跑通一个VLA的pipeline,再逐步加入世界模型的规划能力。
如果你偏研究,建议从世界模型入手。这个方向的学术空间更大——怎么提高想象空间的精度、怎么做更高效的想象训练、怎么把语言接地引入世界模型——这些都是开放问题,容易出成果。
如果你想创业,建议关注两者的交叉地带。比如:用世界模型生成合成数据来训练VLA、用VLA的感知能力来增强世界模型的环境理解。这些方向离产品化更近,而且竞争还没有那么激烈。
写在最后
技术路线之争,在AI历史上从来都不少见。CNN vs RNN,GAN vs VAE,on-policy vs off-policy——回头看,最终胜出的往往不是某一方,而是两者的融合。
VLA和世界模型也是一样。它们不是敌人,而是拼图的两块。谁先把两块拼到一起,谁就能做出真正强大的机器人AI。
作为一个在这个领域工作的工程师,我很庆幸能见证这个过程。不管最终是VLA主导还是世界模型主导,或者两者融合,核心的技术能力是相通的。保持学习,保持好奇心,就不会错。
下一篇文章,我们来聊聊具身智能和强化学习的职业前景:这个方向到底值不值得投入?从业者的路在哪里?敬请期待。
评论