<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>数据 on WorldSense 技术笔记</title><link>https://worldsensetech.com/zh/categories/%E6%95%B0%E6%8D%AE/</link><description>Recent content in 数据 on WorldSense 技术笔记</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Thu, 13 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://worldsensetech.com/zh/categories/%E6%95%B0%E6%8D%AE/index.xml" rel="self" type="application/rss+xml"/><item><title>机器人数据为什么比大模型数据更难？具身智能的数据闭环挑战</title><link>https://worldsensetech.com/zh/articles/robot-data-challenge/</link><pubDate>Thu, 13 Aug 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/robot-data-challenge/</guid><description>&lt;p&gt;大语言模型的发展证明了，大规模、多样化的数据可以显著提升模型能力。但数据规模只是其中一个因素，Transformer 架构、预训练目标、scaling law 以及 RLHF 等后训练方法共同作用，才成就了今天的 LLM。&lt;/p&gt;
&lt;p&gt;但如果你做过机器人 AI，一定知道：机器人领域的数据，比语言数据难得多。&lt;/p&gt;
&lt;p&gt;为什么？机器人数据到底难在哪里？有没有解决方案？&lt;/p&gt;
&lt;p&gt;这篇文章从数据的角度，聊聊具身智能的核心挑战。&lt;/p&gt;
&lt;h2 id="机器人数据的独特挑战"&gt;机器人数据的独特挑战&lt;/h2&gt;
&lt;p&gt;从数据形式上看，文本通常可以被离散化为 token 序列进行处理，而机器人数据天然包含连续控制、多传感器、多时间尺度和物理交互。机器人一次交互涉及 RGB/RGB-D 图像、本体感知（关节状态）、力/力矩、动作轨迹、语言指令、环境状态等多模态信息，具有高维、时序、物理约束和交互依赖等特征。&lt;/p&gt;
&lt;h3 id="1-采集成本高"&gt;1. 采集成本高&lt;/h3&gt;
&lt;p&gt;语言数据可以从互联网上爬取，成本几乎为零。但机器人数据需要真实机器人执行任务，同时记录传感器数据。&lt;/p&gt;
&lt;p&gt;高质量机器人数据采集通常需要昂贵硬件、人工遥操作和大量工程维护。一个复杂任务的数据规模扩展成本远高于互联网数据——不仅需要硬件投入，还需要数据清洗、标注和反复验证。&lt;/p&gt;
&lt;h3 id="2-标注困难"&gt;2. 标注困难&lt;/h3&gt;
&lt;p&gt;语言数据的标注相对简单——分类、实体识别、情感标注，都有明确的标签体系。但机器人数据的标注复杂得多：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;动作标注。机器人动作是连续的高维序列，如何定义&amp;quot;好&amp;quot;的动作？以抓取为例，动作可以是关节轨迹 &lt;code&gt;[q1(t), q2(t)...q7(t)]&lt;/code&gt;、夹爪力、速度、接触状态等。同一个任务存在大量有效解——比如&amp;quot;打开抽屉&amp;quot;可以从左侧拉、从右侧拉、两指抓、三指抓、快速拉或慢速拉——因此机器人数据标注更接近学习一个条件分布 &lt;code&gt;p(action | observation, task)&lt;/code&gt;，而非简单的 &lt;code&gt;f(x) = label&lt;/code&gt; 式的标签预测。&lt;/li&gt;
&lt;li&gt;奖励标注。很多任务没有明确的奖励信号，需要人工设计或从演示中学习。&lt;/li&gt;
&lt;li&gt;场景标注。3D 场景理解、物体位姿、接触点等标注，需要专业工具和知识。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="3-分布狭窄"&gt;3. 分布狭窄&lt;/h3&gt;
&lt;p&gt;语言数据覆盖了各种主题、风格、语言。但机器人数据通常只覆盖：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;特定的机器人硬件&lt;/li&gt;
&lt;li&gt;特定的任务类型&lt;/li&gt;
&lt;li&gt;特定的场景环境&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这导致机器人模型的泛化能力远不如语言模型。在一个机器人上训练的策略，换个机器人可能就失效了。这里还存在一个更深层的问题——embodiment gap：不仅来自机器人形态差异（如 7-DoF 的 Franka 和人形机器人的手），也来自传感器配置（RGB camera vs tactile sensor vs force-torque）、控制频率（20Hz vs 200Hz）和动作空间的差异。这也是 Open X-Embodiment 等跨机器人数据集的重要性所在——它们探索如何利用跨机器人数据提升泛化能力。&lt;/p&gt;
&lt;h3 id="4-安全性要求"&gt;4. 安全性要求&lt;/h3&gt;
&lt;p&gt;机器人模型出错会直接作用于物理世界，因此安全验证要求更加严格。这意味着：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;训练数据需要过滤危险行为&lt;/li&gt;
&lt;li&gt;部署前需要严格的安全验证&lt;/li&gt;
&lt;li&gt;需要人工监督和干预机制&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这些安全要求，增加了数据收集和模型训练的复杂度。&lt;/p&gt;
&lt;h2 id="当前的数据获取与扩展方案"&gt;当前的数据获取与扩展方案&lt;/h2&gt;
&lt;p&gt;面对这些挑战，业界有几种主要的应对策略：&lt;/p&gt;</description></item><item><title>世界模型 + VLA：用想象力训练机器人</title><link>https://worldsensetech.com/zh/articles/world-model-synthetic-data-for-vla/</link><pubDate>Thu, 06 Aug 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/world-model-synthetic-data-for-vla/</guid><description>&lt;p&gt;上一篇&lt;a href="https://worldsensetech.com/zh/articles/world-model-lab-setup/"&gt;从零搭建世界模型实验环境&lt;/a&gt;，我们跑通了 DreamerV3。有读者问：训练好的世界模型能做什么？&lt;/p&gt;
&lt;p&gt;今天聊一个更前沿的话题：怎么用世界模型生成合成数据，来增强 VLA（视觉-语言-动作模型）的训练。这是近年来机器人基础模型领域受到广泛关注的研究方向之一。&lt;/p&gt;
&lt;h2 id="为什么-vla-需要合成数据"&gt;为什么 VLA 需要合成数据&lt;/h2&gt;
&lt;p&gt;VLA 的核心能力是让机器人&amp;quot;听懂人话&amp;quot;——你指着桌上的杯子说&amp;quot;把那个红色的拿给我&amp;quot;，它能理解语言指令并执行动作。&lt;/p&gt;
&lt;p&gt;但训练这样的模型需要海量数据：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;真实数据采集成本高：需要人类示范，每条数据都要人操作机器人&lt;/li&gt;
&lt;li&gt;场景覆盖有限：真实环境难以覆盖所有边界情况（比如光线变化、物体遮挡）&lt;/li&gt;
&lt;li&gt;危险动作无法采集：某些失败案例在真实世界太危险，无法收集&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这就是世界模型的价值所在——它可以在&amp;quot;想象&amp;quot;中生成大量合成数据，弥补真实数据的不足。&lt;/p&gt;
&lt;h2 id="世界模型如何生成合成数据"&gt;世界模型如何生成合成数据&lt;/h2&gt;
&lt;p&gt;回顾一下世界模型的核心能力：给定当前状态和动作，预测未来会发生什么。&lt;/p&gt;
&lt;p&gt;需要说明的是，机器人领域合成数据的来源不仅限于 Dreamer 这类 latent world model，还包括物理模拟器（MuJoCo、Isaac Sim、ManiSkill）、神经渲染环境以及基于视频生成的世界模型。Dreamer 系列是其中适合理解 model-based RL 和 latent imagination 的代表，但实际研究中数据来源更加多元。&lt;/p&gt;
&lt;p&gt;在 DreamerV3 中，RSSM（循环状态空间模型）可以在想象空间中做 rollout：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;从真实观测编码初始 latent state（后验状态）&lt;/li&gt;
&lt;li&gt;采样或指定动作序列&lt;/li&gt;
&lt;li&gt;RSSM 逐步预测 latent state 转移和预期奖励&lt;/li&gt;
&lt;li&gt;通过 observation model 解码 latent state 为观测&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;世界模型生成的是潜在轨迹（latent trajectories），经过视觉解码器和任务条件映射后，可以进一步构造机器人学习需要的视觉-语言-动作数据。&lt;/p&gt;
&lt;p&gt;需要注意：DreamerV3 的 latent imagination 与近年来基于 diffusion/transformer 的大规模视频生成模型不同。DreamerV3 的核心优势在于策略学习（latent dynamics、reward prediction），而不是直接生成高保真机器人视觉数据。用 DreamerV3 decoder 直接重建的图像往往模糊、细节缺失，长时间 rollout 还可能出现物体身份漂移。这也是为什么机器人领域正在转向 video diffusion world model 和 transformer-based world model（如 UniSim、RoboGen、GAIA-1）来获取更高质量的视觉合成数据。&lt;/p&gt;</description></item></channel></rss>