<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>技术路线 on WorldSense 技术笔记</title><link>https://worldsensetech.com/zh/tags/%E6%8A%80%E6%9C%AF%E8%B7%AF%E7%BA%BF/</link><description>Recent content in 技术路线 on WorldSense 技术笔记</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Tue, 04 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://worldsensetech.com/zh/tags/%E6%8A%80%E6%9C%AF%E8%B7%AF%E7%BA%BF/index.xml" rel="self" type="application/rss+xml"/><item><title>VLA vs 世界模型，谁主沉浮？</title><link>https://worldsensetech.com/zh/articles/vla-vs-world-model/</link><pubDate>Tue, 04 Aug 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/vla-vs-world-model/</guid><description>&lt;p&gt;2025年到2026年，机器人AI领域出现了两条截然不同的技术路线。一条是以RT-2、OpenVLA、π0为代表的VLA（Vision-Language-Action，视觉-语言-动作），另一条是以DreamerV3、Genie、DIAMOND为代表的世界模型（World Models）。&lt;/p&gt;
&lt;p&gt;很多同行问我：这两条路线，到底该押哪一边？我的回答是：这个问题本身就问错了。&lt;/p&gt;
&lt;p&gt;今天这篇文章，我想把这两条路线拆开来对比，讲清楚它们各自的逻辑、优势和瓶颈，最后聊聊为什么我认为它们最终会走向融合。&lt;/p&gt;
&lt;h2 id="两条路线的核心逻辑"&gt;两条路线的核心逻辑&lt;/h2&gt;
&lt;p&gt;先说VLA。&lt;/p&gt;
&lt;p&gt;VLA的思路很直接：把机器人的控制问题，变成一个&amp;quot;看图说话&amp;quot;问题。给模型一张摄像头的图片，再给它一句语言指令（比如&amp;quot;把红色杯子放到桌子上&amp;quot;），让它直接输出机器人关节应该怎么动。&lt;/p&gt;
&lt;p&gt;本质上，VLA是一个感知-决策的端到端映射。它不关心物理规律是什么，不关心动力学方程怎么解，它只关心一件事：给定当前看到的画面和语言指令，最优的动作是什么？&lt;/p&gt;
&lt;p&gt;这种方法的灵感来自大语言模型的成功。GPT能&amp;quot;看图说话&amp;quot;，那为什么不能让一个类似的模型&amp;quot;看图做动作&amp;quot;？RT-2（Google DeepMind，2023）第一次证明了这条路可行——它把机器人动作离散化成token，直接用Transformer来预测。从此，VLA成了一个热门方向。&lt;/p&gt;
&lt;p&gt;世界模型的思路完全不同。&lt;/p&gt;
&lt;p&gt;前面几篇文章我详细讲过，世界模型的核心是学习&amp;quot;如果我执行这个动作，环境会怎么变化&amp;quot;。它不是直接从观察映射到动作，而是先建立一个环境的&amp;quot;内部模拟器&amp;quot;，然后在这个模拟器中想象不同动作的后果，再选择最优的方案。&lt;/p&gt;
&lt;p&gt;打个比方：VLA像一个经验丰富的老司机，看到路况就直接打方向盘——靠的是大量驾驶数据训练出来的直觉。世界模型像一个谨慎的新手司机，每次变道前都会先在脑中模拟：&amp;ldquo;如果我变道，后面的车会怎么反应？安全吗？&amp;quot;——靠的是对物理世界的理解。&lt;/p&gt;
&lt;p&gt;一句话总结区别：VLA是&amp;quot;看到就做&amp;rdquo;，世界模型是&amp;quot;想了再做&amp;quot;。&lt;/p&gt;
&lt;h2 id="vla的优势和瓶颈"&gt;VLA的优势和瓶颈&lt;/h2&gt;
&lt;p&gt;VLA最大的优势是数据飞轮。&lt;/p&gt;
&lt;p&gt;互联网上有海量的视觉-语言数据（图片、视频、文本），这些数据都可以用来预训练VLA模型。然后再用少量的机器人操作数据做微调。这让VLA天然具备很强的泛化能力——它能理解没见过的物体，能遵循自然语言指令，甚至能做简单的推理。&lt;/p&gt;
&lt;p&gt;2025年涌现的几个代表性工作，把这种优势发挥到了极致：&lt;/p&gt;
&lt;p&gt;π0（Physical Intelligence，2024）：用flow matching生成连续动作序列，在折叠衣服、装洗碗机等复杂家务任务上表现出色。它证明了预训练VLA可以通过少量任务微调，快速适应新任务。&lt;/p&gt;
&lt;p&gt;OpenVLA（斯坦福/UC Berkeley，2024）：开源的VLA模型，基于Llama-2视觉语言模型微调，在Open X-Embodiment数据集上达到了不错的性能。开源让中小团队也能参与VLA研究。&lt;/p&gt;
&lt;p&gt;RT-2（Google DeepMind，2023）：最早把机器人动作变成token的工作，证明了55B参数的VLA可以zero-shot泛化到没见过的物体和指令。&lt;/p&gt;
&lt;p&gt;但VLA有一个根本性的瓶颈：缺乏长程规划能力。&lt;/p&gt;
&lt;p&gt;VLA的每一次决策都是&amp;quot;看到当前画面→输出动作&amp;quot;，它没有一个长期的&amp;quot;计划&amp;quot;。对于简单的单步任务（抓一个杯子），这没问题。但对于需要多步推理的复杂任务（&amp;ldquo;整理这个房间&amp;rdquo;——需要先收桌子、再扫地、再擦窗户），VLA就容易迷失方向。&lt;/p&gt;
&lt;p&gt;另一个问题是样本效率。VLA需要海量的机器人操作数据来微调。收集这些数据非常昂贵——每个任务都需要真实机器人反复执行，或者用仿真生成再迁移。对于中小团队来说，这是一个很高的门槛。&lt;/p&gt;
&lt;h2 id="世界模型的优势和瓶颈"&gt;世界模型的优势和瓶颈&lt;/h2&gt;
&lt;p&gt;世界模型最大的优势是样本效率和规划能力。&lt;/p&gt;
&lt;p&gt;因为世界模型学会了环境的动态规律，它可以在&amp;quot;想象&amp;quot;中生成大量的训练数据。一个训练好的世界模型，跑一天&amp;quot;想象&amp;quot;产生的数据量，可能超过真实机器人跑一个月。这大幅降低了对真实数据的依赖。&lt;/p&gt;
&lt;p&gt;DreamerV3已经证明了这一点：同一套参数，在55款Atari游戏上从零训练，只需要少量真实交互就能达到高水平表现。在机器人操控任务上，它的样本效率比传统RL高出10-100倍。&lt;/p&gt;
&lt;p&gt;规划能力是世界模型的另一张王牌。因为可以在想象中&amp;quot;预演&amp;quot;未来，世界模型天然适合做长程规划。比如一个机械臂要完成&amp;quot;打开抽屉→取出工具→拧螺丝&amp;quot;这样的多步任务，世界模型可以先在想象中模拟整个流程，找到最优的动作序列，再去执行。&lt;/p&gt;
&lt;p&gt;2025-2026年，世界模型方向也有几个重要进展：&lt;/p&gt;
&lt;p&gt;DIAMOND（2024）：用diffusion model做世界模型，在Atari上超越了DreamerV3的表现。证明了生成模型的范式也可以用于环境建模。&lt;/p&gt;
&lt;p&gt;Genie 2（Google DeepMind，2024）：从视频中学习交互式3D环境，可以从单张图片生成可交互的虚拟世界。虽然还不完美，但方向很有想象力。&lt;/p&gt;
&lt;p&gt;但世界模型也有明显的短板。&lt;/p&gt;
&lt;p&gt;第一是规模化困难。世界模型需要学习环境的动态规律，这意味着它必须对物理世界有很精确的理解。这比VLA的&amp;quot;模式匹配&amp;quot;要难得多。目前的世界模型大多还在实验室级别的简单任务上打转，离大规模应用还有距离。&lt;/p&gt;
&lt;p&gt;第二是语言接地弱。世界模型学习的是视觉-动作的映射，它不太理解自然语言指令。要让世界模型遵循&amp;quot;把红色的杯子放到蓝色的桌子上&amp;quot;这样的指令，需要额外的语言模块，目前还没有很好的解决方案。&lt;/p&gt;
&lt;p&gt;第三是长期预测的误差累积。世界模型在想象中预测越远的未来，误差越大。这限制了它的规划深度——通常只能可靠地预测未来几十步，对于需要上百步的复杂任务，规划质量会明显下降。&lt;/p&gt;
&lt;h2 id="对比一张表看清差异"&gt;对比：一张表看清差异&lt;/h2&gt;
&lt;p&gt;把两条路线放在一起对比：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;维度&lt;/th&gt;
					&lt;th&gt;VLA&lt;/th&gt;
					&lt;th&gt;世界模型&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;核心思路&lt;/td&gt;
					&lt;td&gt;观察→动作的直接映射&lt;/td&gt;
					&lt;td&gt;学习环境动态，想象后行动&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;类比&lt;/td&gt;
					&lt;td&gt;直觉反应（老司机）&lt;/td&gt;
					&lt;td&gt;心理模拟（谨慎新手）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;数据需求&lt;/td&gt;
					&lt;td&gt;大量（需要海量操作数据）&lt;/td&gt;
					&lt;td&gt;较少（想象空间增强）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;泛化能力&lt;/td&gt;
					&lt;td&gt;强（语言接地，可zero-shot）&lt;/td&gt;
					&lt;td&gt;中（受限于训练环境分布）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;规划能力&lt;/td&gt;
					&lt;td&gt;弱（单步决策为主）&lt;/td&gt;
					&lt;td&gt;强（可多步想象推演）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;语言理解&lt;/td&gt;
					&lt;td&gt;强（天然支持语言指令）&lt;/td&gt;
					&lt;td&gt;弱（需要额外模块）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;规模化&lt;/td&gt;
					&lt;td&gt;容易（可复用LLM基础设施）&lt;/td&gt;
					&lt;td&gt;困难（环境建模复杂度高）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;代表工作&lt;/td&gt;
					&lt;td&gt;RT-2, π0, OpenVLA&lt;/td&gt;
					&lt;td&gt;DreamerV3, DIAMOND, Genie 2&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;看完这张表，你可能觉得VLA全面占优。短期来看确实如此——VLA更容易工程化，更容易拿到融资，也更容易做出demo。但世界模型在样本效率和规划能力上的优势，是VLA短期内很难弥补的。&lt;/p&gt;</description></item></channel></rss>