<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>域随机化 on WorldSense 技术笔记</title><link>https://worldsensetech.com/zh/tags/%E5%9F%9F%E9%9A%8F%E6%9C%BA%E5%8C%96/</link><description>Recent content in 域随机化 on WorldSense 技术笔记</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Sat, 08 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://worldsensetech.com/zh/tags/%E5%9F%9F%E9%9A%8F%E6%9C%BA%E5%8C%96/index.xml" rel="self" type="application/rss+xml"/><item><title>域随机化（Domain Randomization）：机器人 Sim-to-Real 迁移的核心技术</title><link>https://worldsensetech.com/zh/articles/domain-randomization-sim-to-real/</link><pubDate>Sat, 08 Aug 2026 00:00:00 +0000</pubDate><guid>https://worldsensetech.com/zh/articles/domain-randomization-sim-to-real/</guid><description>&lt;p&gt;上一篇我们聊了 TD-MPC 如何用世界模型做机器人控制。但不管用 Dreamer、TD-MPC 还是其他方法，训练出来的策略最终都要部署到真实机器人上。这就绕不开 Sim-to-Real 迁移——而域随机化（Domain Randomization）是这条路上最基础的技术。&lt;/p&gt;
&lt;p&gt;这篇文章系统拆解域随机化：它解决什么问题、有哪些类型、工程上怎么实现、以及最新的进展。&lt;/p&gt;
&lt;h2 id="sim-to-real-gap-的根源"&gt;Sim-to-Real Gap 的根源&lt;/h2&gt;
&lt;p&gt;先回顾一下问题。仿真环境和真实世界之间存在系统性差异，这些差异统称为 Sim-to-Real Gap。其中一部分来自未建模动态（unmodeled dynamics），例如摩擦变化、接触误差、传感器噪声等：&lt;/p&gt;
&lt;p&gt;动力学层面：摩擦系数、质量分布、关节阻尼、电机响应延迟。仿真中的物理参数往往是近似值，和真实机器人有偏差。&lt;/p&gt;
&lt;p&gt;视觉层面：光照条件、相机噪声、纹理细节、背景变化。仿真渲染和真实相机看到的图像有显著差异。&lt;/p&gt;
&lt;p&gt;传感器层面：IMU 漂移、力传感器噪声、编码器精度。仿真中的传感器是理想的，真实传感器有各种非理想特性。&lt;/p&gt;
&lt;p&gt;这些差异导致了一个核心问题：在仿真中训练的策略，直接部署到真实世界时性能下降。域随机化的思路很直接——既然真实世界无法被完全建模，就让训练环境覆盖一个合理范围的可能情况，使真实环境成为训练分布中的一个可能实例。&lt;/p&gt;
&lt;h2 id="为什么域随机化现在重新受到关注"&gt;为什么域随机化现在重新受到关注？&lt;/h2&gt;
&lt;p&gt;域随机化并不是新技术——早在 2017 年左右就有系统性的工作。但近几年它的热度明显上升，原因和整个具身智能的研究范式变化有关。&lt;/p&gt;
&lt;p&gt;过去，机器人控制主要靠手工建模和专用控制器。工程师根据具体任务设计动力学模型、调参、写控制逻辑。这种方式在结构化环境中效果不错，但扩展性差——每换一个任务就要重新来一遍。&lt;/p&gt;
&lt;p&gt;现在的范式是：大模型 + 强化学习 + 仿真训练。策略不再由人手工设计，而是在仿真中通过大量试错自动学习。这意味着对训练数据的需求急剧增加。但真实世界的机器人数据太贵、太慢、太危险——不可能让真实机器人每天跑几百万次试错。&lt;/p&gt;
&lt;p&gt;于是，仿真训练成了主流选择。但仿真训练的核心瓶颈变成了：怎么让仿真中学到的能力迁移到真实世界？Sim-to-Real 不再只是一个机器人控制问题，而成为具身智能规模化训练的核心问题。域随机化作为其中最基础、最通用的技术，自然重新受到了关注。&lt;/p&gt;
&lt;h2 id="域随机化的核心思想"&gt;域随机化的核心思想&lt;/h2&gt;
&lt;p&gt;域随机化的直觉来自一个观察：如果策略在足够多样的仿真环境中都能表现良好，那它在真实世界中应该也能工作——因为真实世界只是众多可能环境中的一个。&lt;/p&gt;
&lt;p&gt;形式化地说，域随机化把仿真参数 θ 当作随机变量，从一个分布 p(θ) 中采样。训练时，每个 episode 使用不同的 θ 值。策略学到的不是&amp;quot;在某个特定仿真中怎么做&amp;quot;，而是&amp;quot;在各种可能的环境中怎么做&amp;quot;。
关键洞察：域随机化本质上是在训练数据的分布中注入多样性，让策略学到鲁棒的、不依赖于特定仿真参数的行为。&lt;/p&gt;
&lt;h2 id="域随机化的分类"&gt;域随机化的分类&lt;/h2&gt;
&lt;p&gt;根据随机化的对象，域随机化可以分为四大类：&lt;/p&gt;
&lt;h3 id="1-动力学域随机化dynamics-dr"&gt;1. 动力学域随机化（Dynamics DR）&lt;/h3&gt;
&lt;p&gt;随机化物理参数：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;质量：物体质量、机器人连杆质量。工程中通常从较小范围开始（例如围绕标称值扰动），再根据真实迁移效果逐步扩大范围。&lt;/li&gt;
&lt;li&gt;摩擦：接触摩擦系数、关节摩擦。这是影响操作任务最关键的因素之一。&lt;/li&gt;
&lt;li&gt;阻尼：关节阻尼系数。影响机器人的动态响应。&lt;/li&gt;
&lt;li&gt;惯性：转动惯量。影响旋转运动的动态。&lt;/li&gt;
&lt;li&gt;延迟：控制延迟、观测延迟。模拟真实系统的响应滞后。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;动力学 DR 是最常用的类型，对大多数任务都有显著效果。&lt;/p&gt;
&lt;h3 id="2-视觉域随机化visual-dr"&gt;2. 视觉域随机化（Visual DR）&lt;/h3&gt;
&lt;p&gt;随机化视觉渲染参数：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;光照：光源位置、强度、颜色。这是视觉 DR 中最重要的一项。&lt;/li&gt;
&lt;li&gt;纹理：物体表面纹理、颜色。可以用程序化纹理或随机贴图。&lt;/li&gt;
&lt;li&gt;背景：场景背景。可以用随机颜色、随机图像或随机3D场景。&lt;/li&gt;
&lt;li&gt;相机：相机位置、角度、焦距、噪声。&lt;/li&gt;
&lt;li&gt;材质：反射率、透明度、粗糙度。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;视觉 DR 对基于图像的策略特别重要。如果策略直接用相机图像作为输入，视觉 DR 几乎是必须的。&lt;/p&gt;</description></item></channel></rss>