WorldSense 技术笔记

VLA vs 世界模型,谁主沉浮?

2026年8月4日 · 阅读约14分钟 · VLA, 世界模型, 技术路线

2025年到2026年,机器人AI领域出现了两条截然不同的技术路线。一条是以RT-2、OpenVLA、π0为代表的VLA(Vision-Language-Action,视觉-语言-动作),另一条是以DreamerV3、Genie、DIAMOND为代表的世界模型(World Models)。

很多同行问我:这两条路线,到底该押哪一边?我的回答是:这个问题本身就问错了。

今天这篇文章,我想把这两条路线拆开来对比,讲清楚它们各自的逻辑、优势和瓶颈,最后聊聊为什么我认为它们最终会走向融合。

两条路线的核心逻辑

先说VLA。

VLA的思路很直接:把机器人的控制问题,变成一个"看图说话"问题。给模型一张摄像头的图片,再给它一句语言指令(比如"把红色杯子放到桌子上"),让它直接输出机器人关节应该怎么动。

本质上,VLA是一个感知-决策的端到端映射。它不关心物理规律是什么,不关心动力学方程怎么解,它只关心一件事:给定当前看到的画面和语言指令,最优的动作是什么?

这种方法的灵感来自大语言模型的成功。GPT能"看图说话",那为什么不能让一个类似的模型"看图做动作"?RT-2(Google DeepMind,2023)第一次证明了这条路可行——它把机器人动作离散化成token,直接用Transformer来预测。从此,VLA成了一个热门方向。

世界模型的思路完全不同。

前面几篇文章我详细讲过,世界模型的核心是学习"如果我执行这个动作,环境会怎么变化"。它不是直接从观察映射到动作,而是先建立一个环境的"内部模拟器",然后在这个模拟器中想象不同动作的后果,再选择最优的方案。

打个比方:VLA像一个经验丰富的老司机,看到路况就直接打方向盘——靠的是大量驾驶数据训练出来的直觉。世界模型像一个谨慎的新手司机,每次变道前都会先在脑中模拟:“如果我变道,后面的车会怎么反应?安全吗?"——靠的是对物理世界的理解。

一句话总结区别:VLA是"看到就做”,世界模型是"想了再做"。

VLA的优势和瓶颈

VLA最大的优势是数据飞轮。

互联网上有海量的视觉-语言数据(图片、视频、文本),这些数据都可以用来预训练VLA模型。然后再用少量的机器人操作数据做微调。这让VLA天然具备很强的泛化能力——它能理解没见过的物体,能遵循自然语言指令,甚至能做简单的推理。

2025年涌现的几个代表性工作,把这种优势发挥到了极致:

π0(Physical Intelligence,2024):用flow matching生成连续动作序列,在折叠衣服、装洗碗机等复杂家务任务上表现出色。它证明了预训练VLA可以通过少量任务微调,快速适应新任务。

OpenVLA(斯坦福/UC Berkeley,2024):开源的VLA模型,基于Llama-2视觉语言模型微调,在Open X-Embodiment数据集上达到了不错的性能。开源让中小团队也能参与VLA研究。

RT-2(Google DeepMind,2023):最早把机器人动作变成token的工作,证明了55B参数的VLA可以zero-shot泛化到没见过的物体和指令。

但VLA有一个根本性的瓶颈:缺乏长程规划能力。

VLA的每一次决策都是"看到当前画面→输出动作",它没有一个长期的"计划"。对于简单的单步任务(抓一个杯子),这没问题。但对于需要多步推理的复杂任务(“整理这个房间”——需要先收桌子、再扫地、再擦窗户),VLA就容易迷失方向。

另一个问题是样本效率。VLA需要海量的机器人操作数据来微调。收集这些数据非常昂贵——每个任务都需要真实机器人反复执行,或者用仿真生成再迁移。对于中小团队来说,这是一个很高的门槛。

世界模型的优势和瓶颈

世界模型最大的优势是样本效率和规划能力。

因为世界模型学会了环境的动态规律,它可以在"想象"中生成大量的训练数据。一个训练好的世界模型,跑一天"想象"产生的数据量,可能超过真实机器人跑一个月。这大幅降低了对真实数据的依赖。

DreamerV3已经证明了这一点:同一套参数,在55款Atari游戏上从零训练,只需要少量真实交互就能达到高水平表现。在机器人操控任务上,它的样本效率比传统RL高出10-100倍。

规划能力是世界模型的另一张王牌。因为可以在想象中"预演"未来,世界模型天然适合做长程规划。比如一个机械臂要完成"打开抽屉→取出工具→拧螺丝"这样的多步任务,世界模型可以先在想象中模拟整个流程,找到最优的动作序列,再去执行。

2025-2026年,世界模型方向也有几个重要进展:

DIAMOND(2024):用diffusion model做世界模型,在Atari上超越了DreamerV3的表现。证明了生成模型的范式也可以用于环境建模。

Genie 2(Google DeepMind,2024):从视频中学习交互式3D环境,可以从单张图片生成可交互的虚拟世界。虽然还不完美,但方向很有想象力。

但世界模型也有明显的短板。

第一是规模化困难。世界模型需要学习环境的动态规律,这意味着它必须对物理世界有很精确的理解。这比VLA的"模式匹配"要难得多。目前的世界模型大多还在实验室级别的简单任务上打转,离大规模应用还有距离。

第二是语言接地弱。世界模型学习的是视觉-动作的映射,它不太理解自然语言指令。要让世界模型遵循"把红色的杯子放到蓝色的桌子上"这样的指令,需要额外的语言模块,目前还没有很好的解决方案。

第三是长期预测的误差累积。世界模型在想象中预测越远的未来,误差越大。这限制了它的规划深度——通常只能可靠地预测未来几十步,对于需要上百步的复杂任务,规划质量会明显下降。

对比:一张表看清差异

把两条路线放在一起对比:

维度VLA世界模型
核心思路观察→动作的直接映射学习环境动态,想象后行动
类比直觉反应(老司机)心理模拟(谨慎新手)
数据需求大量(需要海量操作数据)较少(想象空间增强)
泛化能力强(语言接地,可zero-shot)中(受限于训练环境分布)
规划能力弱(单步决策为主)强(可多步想象推演)
语言理解强(天然支持语言指令)弱(需要额外模块)
规模化容易(可复用LLM基础设施)困难(环境建模复杂度高)
代表工作RT-2, π0, OpenVLADreamerV3, DIAMOND, Genie 2

看完这张表,你可能觉得VLA全面占优。短期来看确实如此——VLA更容易工程化,更容易拿到融资,也更容易做出demo。但世界模型在样本效率和规划能力上的优势,是VLA短期内很难弥补的。

我的判断:不是谁替代谁,而是谁和谁结合

说了这么多对比,最后说说我自己的看法。

我认为VLA和世界模型不是竞争关系,而是互补关系。最终的方向,一定是两者的融合。

为什么?因为它们各自解决了对方最弱的那个环节。

VLA的优势是泛化和语言接地,但缺乏规划。世界模型的优势是规划和样本效率,但泛化和语言理解弱。如果把两者结合起来——用一个世界模型来做"想象"和规划,用一个VLA来做感知和语言理解——就能得到一个既有直觉又有深思熟虑的系统。

其实这个趋势已经出现了。

π0虽然被归类为VLA,但它用了flow matching来生成动作序列——这本质上就是一种"想象"。它不是简单地输出一个动作,而是生成一整个动作序列,然后在执行过程中不断修正。这已经有了世界模型的影子。

Genie 2虽然被归类为世界模型,但它从视频中学习的方式,和VLA从数据中学习感知-动作映射的方式非常相似。两者的技术边界正在模糊。

我自己的判断是:2026-2027年,我们会看到越来越多"VLA + 世界模型"的混合架构出现。具体来说,可能的架构是:

这种"感知-规划-执行"的三层架构,既有人类认知的影子(系统1快思考 + 系统2慢思考),也有工程上的合理性。

对从业者的建议

如果你是想进入这个方向的工程师或研究生,我的建议是:不要只押一边。

学VLA,但也要理解世界模型的原理。学世界模型,但也要关注VLA的最新进展。两条路线的技术栈有大量重叠——Transformer架构、视觉编码器、强化学习基础——这些是通用的。

具体来说:

如果你偏工程,建议从VLA入手。OpenVLA是开源的,数据集是公开的,技术栈和LLM高度重合,更容易上手。先跑通一个VLA的pipeline,再逐步加入世界模型的规划能力。

如果你偏研究,建议从世界模型入手。这个方向的学术空间更大——怎么提高想象空间的精度、怎么做更高效的想象训练、怎么把语言接地引入世界模型——这些都是开放问题,容易出成果。

如果你想创业,建议关注两者的交叉地带。比如:用世界模型生成合成数据来训练VLA、用VLA的感知能力来增强世界模型的环境理解。这些方向离产品化更近,而且竞争还没有那么激烈。

写在最后

技术路线之争,在AI历史上从来都不少见。CNN vs RNN,GAN vs VAE,on-policy vs off-policy——回头看,最终胜出的往往不是某一方,而是两者的融合。

VLA和世界模型也是一样。它们不是敌人,而是拼图的两块。谁先把两块拼到一起,谁就能做出真正强大的机器人AI。

作为一个在这个领域工作的工程师,我很庆幸能见证这个过程。不管最终是VLA主导还是世界模型主导,或者两者融合,核心的技术能力是相通的。保持学习,保持好奇心,就不会错。

下一篇文章,我们来聊聊具身智能和强化学习的职业前景:这个方向到底值不值得投入?从业者的路在哪里?敬请期待。


← 世界模型(world model)当下是一个好的方向吗? 具身智能、强化学习的前景如何? →

评论

W
侯晓琴

西北工业大学硕士,十余年自动化与 AI 工程经验。著有《Visual C++入门很容易》《C++程序设计经典300例》。目前聚焦世界模型与具身智能方向,记录从传统自动化到机器人 AI 的转型之路。