<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>VLA on WorldSense 技术笔记</title><link>https://worldsensetech.com/zh/tags/vla/</link><description>Recent content in VLA on WorldSense 技术笔记</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Thu, 13 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://worldsensetech.com/zh/tags/vla/index.xml" rel="self" type="application/rss+xml"/><item><title>机器人数据为什么比大模型数据更难？具身智能的数据闭环挑战</title><link>https://worldsensetech.com/zh/articles/robot-data-challenge/</link><pubDate>Thu, 13 Aug 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/robot-data-challenge/</guid><description>&lt;p&gt;大语言模型的发展证明了，大规模、多样化的数据可以显著提升模型能力。但数据规模只是其中一个因素，Transformer 架构、预训练目标、scaling law 以及 RLHF 等后训练方法共同作用，才成就了今天的 LLM。&lt;/p&gt;
&lt;p&gt;但如果你做过机器人 AI，一定知道：机器人领域的数据，比语言数据难得多。&lt;/p&gt;
&lt;p&gt;为什么？机器人数据到底难在哪里？有没有解决方案？&lt;/p&gt;
&lt;p&gt;这篇文章从数据的角度，聊聊具身智能的核心挑战。&lt;/p&gt;
&lt;h2 id="机器人数据的独特挑战"&gt;机器人数据的独特挑战&lt;/h2&gt;
&lt;p&gt;从数据形式上看，文本通常可以被离散化为 token 序列进行处理，而机器人数据天然包含连续控制、多传感器、多时间尺度和物理交互。机器人一次交互涉及 RGB/RGB-D 图像、本体感知（关节状态）、力/力矩、动作轨迹、语言指令、环境状态等多模态信息，具有高维、时序、物理约束和交互依赖等特征。&lt;/p&gt;
&lt;h3 id="1-采集成本高"&gt;1. 采集成本高&lt;/h3&gt;
&lt;p&gt;语言数据可以从互联网上爬取，成本几乎为零。但机器人数据需要真实机器人执行任务，同时记录传感器数据。&lt;/p&gt;
&lt;p&gt;高质量机器人数据采集通常需要昂贵硬件、人工遥操作和大量工程维护。一个复杂任务的数据规模扩展成本远高于互联网数据——不仅需要硬件投入，还需要数据清洗、标注和反复验证。&lt;/p&gt;
&lt;h3 id="2-标注困难"&gt;2. 标注困难&lt;/h3&gt;
&lt;p&gt;语言数据的标注相对简单——分类、实体识别、情感标注，都有明确的标签体系。但机器人数据的标注复杂得多：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;动作标注。机器人动作是连续的高维序列，如何定义&amp;quot;好&amp;quot;的动作？以抓取为例，动作可以是关节轨迹 &lt;code&gt;[q1(t), q2(t)...q7(t)]&lt;/code&gt;、夹爪力、速度、接触状态等。同一个任务存在大量有效解——比如&amp;quot;打开抽屉&amp;quot;可以从左侧拉、从右侧拉、两指抓、三指抓、快速拉或慢速拉——因此机器人数据标注更接近学习一个条件分布 &lt;code&gt;p(action | observation, task)&lt;/code&gt;，而非简单的 &lt;code&gt;f(x) = label&lt;/code&gt; 式的标签预测。&lt;/li&gt;
&lt;li&gt;奖励标注。很多任务没有明确的奖励信号，需要人工设计或从演示中学习。&lt;/li&gt;
&lt;li&gt;场景标注。3D 场景理解、物体位姿、接触点等标注，需要专业工具和知识。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="3-分布狭窄"&gt;3. 分布狭窄&lt;/h3&gt;
&lt;p&gt;语言数据覆盖了各种主题、风格、语言。但机器人数据通常只覆盖：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;特定的机器人硬件&lt;/li&gt;
&lt;li&gt;特定的任务类型&lt;/li&gt;
&lt;li&gt;特定的场景环境&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这导致机器人模型的泛化能力远不如语言模型。在一个机器人上训练的策略，换个机器人可能就失效了。这里还存在一个更深层的问题——embodiment gap：不仅来自机器人形态差异（如 7-DoF 的 Franka 和人形机器人的手），也来自传感器配置（RGB camera vs tactile sensor vs force-torque）、控制频率（20Hz vs 200Hz）和动作空间的差异。这也是 Open X-Embodiment 等跨机器人数据集的重要性所在——它们探索如何利用跨机器人数据提升泛化能力。&lt;/p&gt;
&lt;h3 id="4-安全性要求"&gt;4. 安全性要求&lt;/h3&gt;
&lt;p&gt;机器人模型出错会直接作用于物理世界，因此安全验证要求更加严格。这意味着：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;训练数据需要过滤危险行为&lt;/li&gt;
&lt;li&gt;部署前需要严格的安全验证&lt;/li&gt;
&lt;li&gt;需要人工监督和干预机制&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这些安全要求，增加了数据收集和模型训练的复杂度。&lt;/p&gt;
&lt;h2 id="当前的数据获取与扩展方案"&gt;当前的数据获取与扩展方案&lt;/h2&gt;
&lt;p&gt;面对这些挑战，业界有几种主要的应对策略：&lt;/p&gt;</description></item><item><title>世界模型 + VLA：用想象力训练机器人</title><link>https://worldsensetech.com/zh/articles/world-model-synthetic-data-for-vla/</link><pubDate>Thu, 06 Aug 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/world-model-synthetic-data-for-vla/</guid><description>&lt;p&gt;上一篇&lt;a href="https://worldsensetech.com/zh/articles/world-model-lab-setup/"&gt;从零搭建世界模型实验环境&lt;/a&gt;，我们跑通了 DreamerV3。有读者问：训练好的世界模型能做什么？&lt;/p&gt;
&lt;p&gt;今天聊一个更前沿的话题：怎么用世界模型生成合成数据，来增强 VLA（视觉-语言-动作模型）的训练。这是近年来机器人基础模型领域受到广泛关注的研究方向之一。&lt;/p&gt;
&lt;h2 id="为什么-vla-需要合成数据"&gt;为什么 VLA 需要合成数据&lt;/h2&gt;
&lt;p&gt;VLA 的核心能力是让机器人&amp;quot;听懂人话&amp;quot;——你指着桌上的杯子说&amp;quot;把那个红色的拿给我&amp;quot;，它能理解语言指令并执行动作。&lt;/p&gt;
&lt;p&gt;但训练这样的模型需要海量数据：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;真实数据采集成本高：需要人类示范，每条数据都要人操作机器人&lt;/li&gt;
&lt;li&gt;场景覆盖有限：真实环境难以覆盖所有边界情况（比如光线变化、物体遮挡）&lt;/li&gt;
&lt;li&gt;危险动作无法采集：某些失败案例在真实世界太危险，无法收集&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这就是世界模型的价值所在——它可以在&amp;quot;想象&amp;quot;中生成大量合成数据，弥补真实数据的不足。&lt;/p&gt;
&lt;h2 id="世界模型如何生成合成数据"&gt;世界模型如何生成合成数据&lt;/h2&gt;
&lt;p&gt;回顾一下世界模型的核心能力：给定当前状态和动作，预测未来会发生什么。&lt;/p&gt;
&lt;p&gt;需要说明的是，机器人领域合成数据的来源不仅限于 Dreamer 这类 latent world model，还包括物理模拟器（MuJoCo、Isaac Sim、ManiSkill）、神经渲染环境以及基于视频生成的世界模型。Dreamer 系列是其中适合理解 model-based RL 和 latent imagination 的代表，但实际研究中数据来源更加多元。&lt;/p&gt;
&lt;p&gt;在 DreamerV3 中，RSSM（循环状态空间模型）可以在想象空间中做 rollout：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;从真实观测编码初始 latent state（后验状态）&lt;/li&gt;
&lt;li&gt;采样或指定动作序列&lt;/li&gt;
&lt;li&gt;RSSM 逐步预测 latent state 转移和预期奖励&lt;/li&gt;
&lt;li&gt;通过 observation model 解码 latent state 为观测&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;世界模型生成的是潜在轨迹（latent trajectories），经过视觉解码器和任务条件映射后，可以进一步构造机器人学习需要的视觉-语言-动作数据。&lt;/p&gt;
&lt;p&gt;需要注意：DreamerV3 的 latent imagination 与近年来基于 diffusion/transformer 的大规模视频生成模型不同。DreamerV3 的核心优势在于策略学习（latent dynamics、reward prediction），而不是直接生成高保真机器人视觉数据。用 DreamerV3 decoder 直接重建的图像往往模糊、细节缺失，长时间 rollout 还可能出现物体身份漂移。这也是为什么机器人领域正在转向 video diffusion world model 和 transformer-based world model（如 UniSim、RoboGen、GAIA-1）来获取更高质量的视觉合成数据。&lt;/p&gt;</description></item><item><title>VLA vs 世界模型，谁主沉浮？</title><link>https://worldsensetech.com/zh/articles/vla-vs-world-model/</link><pubDate>Tue, 04 Aug 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/vla-vs-world-model/</guid><description>&lt;p&gt;2025年到2026年，机器人AI领域出现了两条截然不同的技术路线。一条是以RT-2、OpenVLA、π0为代表的VLA（Vision-Language-Action，视觉-语言-动作），另一条是以DreamerV3、Genie、DIAMOND为代表的世界模型（World Models）。&lt;/p&gt;
&lt;p&gt;很多同行问我：这两条路线，到底该押哪一边？我的回答是：这个问题本身就问错了。&lt;/p&gt;
&lt;p&gt;今天这篇文章，我想把这两条路线拆开来对比，讲清楚它们各自的逻辑、优势和瓶颈，最后聊聊为什么我认为它们最终会走向融合。&lt;/p&gt;
&lt;h2 id="两条路线的核心逻辑"&gt;两条路线的核心逻辑&lt;/h2&gt;
&lt;p&gt;先说VLA。&lt;/p&gt;
&lt;p&gt;VLA的思路很直接：把机器人的控制问题，变成一个&amp;quot;看图说话&amp;quot;问题。给模型一张摄像头的图片，再给它一句语言指令（比如&amp;quot;把红色杯子放到桌子上&amp;quot;），让它直接输出机器人关节应该怎么动。&lt;/p&gt;
&lt;p&gt;本质上，VLA是一个感知-决策的端到端映射。它不关心物理规律是什么，不关心动力学方程怎么解，它只关心一件事：给定当前看到的画面和语言指令，最优的动作是什么？&lt;/p&gt;
&lt;p&gt;这种方法的灵感来自大语言模型的成功。GPT能&amp;quot;看图说话&amp;quot;，那为什么不能让一个类似的模型&amp;quot;看图做动作&amp;quot;？RT-2（Google DeepMind，2023）第一次证明了这条路可行——它把机器人动作离散化成token，直接用Transformer来预测。从此，VLA成了一个热门方向。&lt;/p&gt;
&lt;p&gt;世界模型的思路完全不同。&lt;/p&gt;
&lt;p&gt;前面几篇文章我详细讲过，世界模型的核心是学习&amp;quot;如果我执行这个动作，环境会怎么变化&amp;quot;。它不是直接从观察映射到动作，而是先建立一个环境的&amp;quot;内部模拟器&amp;quot;，然后在这个模拟器中想象不同动作的后果，再选择最优的方案。&lt;/p&gt;
&lt;p&gt;打个比方：VLA像一个经验丰富的老司机，看到路况就直接打方向盘——靠的是大量驾驶数据训练出来的直觉。世界模型像一个谨慎的新手司机，每次变道前都会先在脑中模拟：&amp;ldquo;如果我变道，后面的车会怎么反应？安全吗？&amp;quot;——靠的是对物理世界的理解。&lt;/p&gt;
&lt;p&gt;一句话总结区别：VLA是&amp;quot;看到就做&amp;rdquo;，世界模型是&amp;quot;想了再做&amp;quot;。&lt;/p&gt;
&lt;h2 id="vla的优势和瓶颈"&gt;VLA的优势和瓶颈&lt;/h2&gt;
&lt;p&gt;VLA最大的优势是数据飞轮。&lt;/p&gt;
&lt;p&gt;互联网上有海量的视觉-语言数据（图片、视频、文本），这些数据都可以用来预训练VLA模型。然后再用少量的机器人操作数据做微调。这让VLA天然具备很强的泛化能力——它能理解没见过的物体，能遵循自然语言指令，甚至能做简单的推理。&lt;/p&gt;
&lt;p&gt;2025年涌现的几个代表性工作，把这种优势发挥到了极致：&lt;/p&gt;
&lt;p&gt;π0（Physical Intelligence，2024）：用flow matching生成连续动作序列，在折叠衣服、装洗碗机等复杂家务任务上表现出色。它证明了预训练VLA可以通过少量任务微调，快速适应新任务。&lt;/p&gt;
&lt;p&gt;OpenVLA（斯坦福/UC Berkeley，2024）：开源的VLA模型，基于Llama-2视觉语言模型微调，在Open X-Embodiment数据集上达到了不错的性能。开源让中小团队也能参与VLA研究。&lt;/p&gt;
&lt;p&gt;RT-2（Google DeepMind，2023）：最早把机器人动作变成token的工作，证明了55B参数的VLA可以zero-shot泛化到没见过的物体和指令。&lt;/p&gt;
&lt;p&gt;但VLA有一个根本性的瓶颈：缺乏长程规划能力。&lt;/p&gt;
&lt;p&gt;VLA的每一次决策都是&amp;quot;看到当前画面→输出动作&amp;quot;，它没有一个长期的&amp;quot;计划&amp;quot;。对于简单的单步任务（抓一个杯子），这没问题。但对于需要多步推理的复杂任务（&amp;ldquo;整理这个房间&amp;rdquo;——需要先收桌子、再扫地、再擦窗户），VLA就容易迷失方向。&lt;/p&gt;
&lt;p&gt;另一个问题是样本效率。VLA需要海量的机器人操作数据来微调。收集这些数据非常昂贵——每个任务都需要真实机器人反复执行，或者用仿真生成再迁移。对于中小团队来说，这是一个很高的门槛。&lt;/p&gt;
&lt;h2 id="世界模型的优势和瓶颈"&gt;世界模型的优势和瓶颈&lt;/h2&gt;
&lt;p&gt;世界模型最大的优势是样本效率和规划能力。&lt;/p&gt;
&lt;p&gt;因为世界模型学会了环境的动态规律，它可以在&amp;quot;想象&amp;quot;中生成大量的训练数据。一个训练好的世界模型，跑一天&amp;quot;想象&amp;quot;产生的数据量，可能超过真实机器人跑一个月。这大幅降低了对真实数据的依赖。&lt;/p&gt;
&lt;p&gt;DreamerV3已经证明了这一点：同一套参数，在55款Atari游戏上从零训练，只需要少量真实交互就能达到高水平表现。在机器人操控任务上，它的样本效率比传统RL高出10-100倍。&lt;/p&gt;
&lt;p&gt;规划能力是世界模型的另一张王牌。因为可以在想象中&amp;quot;预演&amp;quot;未来，世界模型天然适合做长程规划。比如一个机械臂要完成&amp;quot;打开抽屉→取出工具→拧螺丝&amp;quot;这样的多步任务，世界模型可以先在想象中模拟整个流程，找到最优的动作序列，再去执行。&lt;/p&gt;
&lt;p&gt;2025-2026年，世界模型方向也有几个重要进展：&lt;/p&gt;
&lt;p&gt;DIAMOND（2024）：用diffusion model做世界模型，在Atari上超越了DreamerV3的表现。证明了生成模型的范式也可以用于环境建模。&lt;/p&gt;
&lt;p&gt;Genie 2（Google DeepMind，2024）：从视频中学习交互式3D环境，可以从单张图片生成可交互的虚拟世界。虽然还不完美，但方向很有想象力。&lt;/p&gt;
&lt;p&gt;但世界模型也有明显的短板。&lt;/p&gt;
&lt;p&gt;第一是规模化困难。世界模型需要学习环境的动态规律，这意味着它必须对物理世界有很精确的理解。这比VLA的&amp;quot;模式匹配&amp;quot;要难得多。目前的世界模型大多还在实验室级别的简单任务上打转，离大规模应用还有距离。&lt;/p&gt;
&lt;p&gt;第二是语言接地弱。世界模型学习的是视觉-动作的映射，它不太理解自然语言指令。要让世界模型遵循&amp;quot;把红色的杯子放到蓝色的桌子上&amp;quot;这样的指令，需要额外的语言模块，目前还没有很好的解决方案。&lt;/p&gt;
&lt;p&gt;第三是长期预测的误差累积。世界模型在想象中预测越远的未来，误差越大。这限制了它的规划深度——通常只能可靠地预测未来几十步，对于需要上百步的复杂任务，规划质量会明显下降。&lt;/p&gt;
&lt;h2 id="对比一张表看清差异"&gt;对比：一张表看清差异&lt;/h2&gt;
&lt;p&gt;把两条路线放在一起对比：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;维度&lt;/th&gt;
					&lt;th&gt;VLA&lt;/th&gt;
					&lt;th&gt;世界模型&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;核心思路&lt;/td&gt;
					&lt;td&gt;观察→动作的直接映射&lt;/td&gt;
					&lt;td&gt;学习环境动态，想象后行动&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;类比&lt;/td&gt;
					&lt;td&gt;直觉反应（老司机）&lt;/td&gt;
					&lt;td&gt;心理模拟（谨慎新手）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;数据需求&lt;/td&gt;
					&lt;td&gt;大量（需要海量操作数据）&lt;/td&gt;
					&lt;td&gt;较少（想象空间增强）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;泛化能力&lt;/td&gt;
					&lt;td&gt;强（语言接地，可zero-shot）&lt;/td&gt;
					&lt;td&gt;中（受限于训练环境分布）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;规划能力&lt;/td&gt;
					&lt;td&gt;弱（单步决策为主）&lt;/td&gt;
					&lt;td&gt;强（可多步想象推演）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;语言理解&lt;/td&gt;
					&lt;td&gt;强（天然支持语言指令）&lt;/td&gt;
					&lt;td&gt;弱（需要额外模块）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;规模化&lt;/td&gt;
					&lt;td&gt;容易（可复用LLM基础设施）&lt;/td&gt;
					&lt;td&gt;困难（环境建模复杂度高）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;代表工作&lt;/td&gt;
					&lt;td&gt;RT-2, π0, OpenVLA&lt;/td&gt;
					&lt;td&gt;DreamerV3, DIAMOND, Genie 2&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;看完这张表，你可能觉得VLA全面占优。短期来看确实如此——VLA更容易工程化，更容易拿到融资，也更容易做出demo。但世界模型在样本效率和规划能力上的优势，是VLA短期内很难弥补的。&lt;/p&gt;</description></item></channel></rss>