把发布状态机跑起来:一台纯 stdlib 最小闭环与十七个 invariant
9/22 概念篇把部署与回滚讲成一台带证据的状态机,但只给设计、没摊开代码。这一篇是那半句“文末再用一套纯 stdlib 假实现把它跑起来”的兑现:完整贴出 deploy_fakes.py、逐条钉住 I1–I17 的 test_deploy.py,并实跑(17 passed)。前置:复用 9/19 …
专注具身智能、世界模型与 Sim-to-Real 的技术博客。从算法研究到工程实践,记录机器人 AI 的探索之路。
作者:西北工业大学硕士 · 机器人 AI 工程师 · 著有《Visual C++入门很容易》
9/22 概念篇把部署与回滚讲成一台带证据的状态机,但只给设计、没摊开代码。这一篇是那半句“文末再用一套纯 stdlib 假实现把它跑起来”的兑现:完整贴出 deploy_fakes.py、逐条钉住 I1–I17 的 test_deploy.py,并实跑(17 passed)。前置:复用 9/19 …
9/17 给出了能跑、能测、能换组件的 Agent 骨架,这篇回答下一问:换下去的那一瞬间靠什么兜底。Web 服务回滚是撤销,机器人回滚是让旧决策失权——发布身份(分层 manifest + 签名语义)、runtime 的 schema×config×观测指纹兼容性网格(包含而非相交)、shadow …
前面几篇把'具身智能缺的是接口不是模型'讲成了契约和评估协议,这篇落到工程:一个具身 Agent 的代码到底怎么组织。给出运行时栈与训练时栈的分层、StateContract / Action / Env 三条核心契约、时间化动作与 active/scheduled 双槽、epoch 屏障的 …
本文承接 9/15《契约立起来之后:VLA、Diffusion Policy、π0 到底在消费什么》,把 policy 侧 contract consumer 的**评估协议、训练约束与最小可执行接口**独立成篇。前篇负责 framework 与失败模式、本文负责"如何测 / 如何训 / 如何落地 …
本文是"政策侧接口"长文的**上半 · framework 篇**、下半(evaluation + Python 骨架 + 训练时连锁)在 9/16 [政策侧评估(下)](/zh/articles/2026-09-16-policy-side-evaluation/)。《多模态融合接口》那一篇把上游 …
多模态融合常被讲成"选哪种 attention 结构"的问题、但机器人场景真正的瓶颈在更上游:Vision / Tactile / Force-torque / Proprioception 四路信号在时间基、坐标系基、任务语义、有效性与来源上从来没对齐过。本文把系统拆成四层 …
通用机器人真正稀缺的、不是"再多一个触觉传感器"、而是一条把异构接触信号稳定转换成任务相关接触状态、并实时进入控制闭环的能力。本文以"闭环"为贯穿框架、把 sensor / raw observation / contact perception / state estimation / …
三部曲-评估与落地篇。Sim fidelity 不只有一个维度——数值预测、排序准确性、选出的 policy 好不好、三维不能互替;本文给出 gap x 可建模性 x 真机预算的决策矩阵、stopping rule 三类、以及一套 6 步最小可执行 Allocation Protocol。理论 …
三部曲-方法篇。把 SI / DR / DA / FT 读成四个可组合的 intervention lens(Model x Data x Representation x Optimization)、不是四选一;再加 World Model 与 Sim-and-Real Co-training 两 …
三部曲-理论篇。Sim-to-real 不是单一迁移技巧、而是闭环资源分配。本文把 reality gap 重述成 policy-conditioned 多源 mismatch、以 intervention sensitivity 与 cost-normalized marginal value 把 …
机器人领域真正值得 scaling 的,不只是 trajectory 数量,而是 interaction distribution 相对于目标 evaluation distribution 的有效覆盖。本文给出一个从 interaction …
随着 VLA、世界模型等基础范式逐渐出现较清晰的主流路线,数据分布、数据质量和 training recipe 正越来越成为决定机器人性能的重要变量。本篇(上篇)梳理机器人数据的来源与接口、为什么'数据不是 dataset 而是 distribution'、training recipe 如何决定模 …
VLA 系列三篇的下篇。讨论 VLA 与世界模型的关系——区分被动预测、action-conditioned 和 subgoal generator 三类世界模型,并展开数据瓶颈、长时序、安全、缺失模态等开放问题,最后收束为三个判断。
从 π₀、Gemini Robotics 到 GR00T、Cosmos、TD-MPC2:具身智能正在形成怎样的技术栈?本文从 Policy、Dynamics、Infrastructure 三个维度盘点主要玩家的技术路线与进展阶段,试图回答一个基本问题——这个领域谁在解决什么问题?
VLA 系列三篇的中篇。π₀ 用 flow matching 实现连续动作生成,π₀.5 引入离散-连续混合 recipe,π₀.7 用 context-rich steering 和视觉子目标扩展泛化能力——拆解动作接口演进的核心技术密度,并提出 Training Interface vs …
RSSM 是 Dreamer 系列世界模型的核心引擎,但状态空间建模的版图在过去几年发生了很大变化。本文把 RSSM 放在更大的 state-space modeling 演进中审视——区分 latent dynamics 与 sequence backbone 两个层面,讨论 TD-MPC2 的 …
VLA 系列三篇的上篇。从 RT-2 把互联网知识注入机器人控制,到 OpenVLA 用 7B 参数在 29 个任务上超过 55B 闭源模型,再到 OFT 揭示 action interface 才是瓶颈——逐篇拆解 VLA 的基础架构与早期演进,区分动作表示、动作生成、时序抽象、上下文 …
从 2022 年的理论蓝图到 I-JEPA、V-JEPA,再到 V-JEPA 2 的视频预测、动作条件预测与机器人规划演示,LeCun 的 JEPA 路线逐步从预测性表征学习走向世界模型研究。这篇文章逐篇拆解这条技术路线,并讨论它与 Dreamer/RSSM、生成式世界模型之间的真正区别。
截至 2026 年 8 月底,世界模型方向正在经历一次深层分化。从 NVIDIA Cosmos 到 Google Genie 3,从 LeCun 的 AMI Labs 到 Fei-Fei Li 的 World Labs,不同技术路线开始走向不同的应用场景。本文尝试理清这些项目和论文之间的关系。
从 DreamerV3 出发,解析 Transformer 世界模型、V-JEPA、Genie、LLM Agent 和机器人基础模型的发展路线与融合趋势。
Dreamer 系列在实际任务中的表现如何?从 DMC、Atari 到机器人控制,再到 Sim-to-Real 的探索与挑战。
跑 DreamerV3 到底需要什么样的 GPU?这篇从显存需求、单步耗时、多任务并行能力和性价比四个维度,对比 4090 / A100 / H100 在不同任务规模下的实测表现,并给出一份按预算区分的选型建议——避免买了卡跑不满,也避免预算被不必要地抬高。
把 DreamerV3 从零跑通到自己项目里可以复用,中间会踩的工程坑远不止论文里那几行超参。这篇整理我们在 GPU 显存优化、actor-critic 稳定训练、reward normalization,以及常见 NaN、不收敛、学习曲线异常等问题的定位思路和解决方案——适合已经跑通 …
从源码理解 Dreamer 的 Actor-Critic 设计:imagine loop、λ-return、two-hot value prediction 和 symlog 变换。
从传感器到执行器,拆解世界模型在机器人系统中的完整链路:感知融合、隐状态预测、策略学习、Sim-to-Real 迁移,以及不同机器人形态对世界模型的需求差异。
从 RSSM 架构到 imagination 机制,完整拆解 Dreamer 如何在隐空间中构建世界模型、生成训练数据并优化策略,附源码级解读。
收尾:把 RSSM 拆成架构/训练两张配置表,压缩成四条核心公式,给出代码↔数学↔语义对照表,并从 Memory / State estimation / Prediction 重新理解 RSSM。
脱离 observation 的未来模拟:imagine 的完整闭环、Observe 与 Imagine 的本质区别、为什么 imagination 不能无限长,以及 sequence training 与 reset 的作用。
训练世界模型的核心:Observe 阶段完整数据流、dyn/rep 两个 KL 的 gradient routing、free_nats 作为 loss floor,以及最终 KL loss 如何组合。
追踪真正的确定性动力学:_core() 如何做单步转移、为什么 deter 取 8192、Block GRU 的 block-wise 参数化,以及 posterior/prior 网络各自做什么。
把源码翻译成数学,明确时间索引;理解 prior 与 posterior 两套分布、categorical 的 straight-through 采样,以及 unimix 给每个类别加概率下界的作用。
系列开篇:先定位 RSSM 在 DreamerV3 中的角色,澄清 stochastic state 不是“整数再 one-hot”,再看真实 observation 如何进入 RSSM(observe 的调用层次)。
世界模型最近半年被反复提起,但很多讨论其实混用了不同层次的东西。这篇从技术成熟度、可复现性、落地场景到商业闭环逐层拆解,尝试分清哪些是真突破、哪些还在论文阶段、哪些更多是被叙事放大出来的泡沫——帮你把关注点放回到真正会影响未来两三年的那几条分支上。
租云 GPU 按小时计费灵活但长期贵,自建工作站一次性投入大但利用率不稳定。从显存需求、训练时长到电费网费,算一笔真实的成本账。
从人形机器人到自动驾驶,从无人机到工业机械臂——2026 年 AI 公司纷纷为算法寻找物理载体。分析这股趋势背后的技术驱动力和产业逻辑。
Isaac Lab 从安装到跑通第一个 example 的完整流程,覆盖环境配置、常见报错排查、AutoDL 云端部署方案,帮你跳过所有坑。
Isaac Lab 是 NVIDIA 面向具身智能的 GPU 加速机器人学习平台。从平台架构、并行训练能力到与 MuJoCo 的差异,帮你理解它为什么被越来越多团队采用。
大模型有互联网文本数据,但机器人没有。具身智能面临的核心数据难题:采集成本高、分布偏移大、仿真与真实鸿沟深。拆解数据闭环的挑战与可能的解法。
从 RSSM 的循环架构到 Transformer 的序列建模,再到 UniSim/Cosmos 的统一世界模型——梳理世界模型架构的演进脉络和未来方向。
训练 DreamerV3 最常踩的坑:显存溢出、奖励不收敛、超参数敏感。从 MuJoCo 环境配置到训练稳定性调优,一份实战经验总结。
世界模型用什么来「表示」世界?对比像素空间、隐状态空间、3D 结构和物体中心四条表征路线,分析各自对机器人适应能力的优劣。
从物理引擎、渲染方式、GPU 并行能力到社区生态,全面对比 MuJoCo 和 Isaac Sim 两大机器人仿真平台,帮你根据任务需求做出选择。
仿真里训练的策略为什么一到真实机器人就失效?域随机化通过随机化物理参数、视觉外观和传感器噪声,让策略学会「忽略差异」,是目前最实用的 Sim-to-Real 方案。
RSSM 不是世界模型用于机器人控制的唯一路线。TD-MPC 用模型预测控制在隐空间中直接优化动作序列,不需要显式策略网络。对比两种路线的设计哲学和适用场景。
真实机器人数据采集成本高、覆盖面窄。用训练好的世界模型生成合成数据来增强 VLA 训练,相当于让机器人在「想象」中学习,大幅提升样本效率。
从零搭建世界模型实验环境:安装 MuJoCo、配置 DreamerV3 代码库、跑通第一个训练任务。覆盖环境踩坑、依赖版本兼容和训练参数配置。
高德 ABot-World-0 将交互式世界模型的推理时长从 1 分钟提升到 24 小时,这意味着什么?从技术突破到产业影响,解读这一里程碑的核心意义。
仿真训练的策略部署到真实机器人时性能暴跌 30-50%,这就是 Sim-to-Real Gap。世界模型通过生成合成数据和自适应迁移,正在提供一条新的解决思路。
强化学习和具身智能正处于从实验室走向产业的关键阶段。从技术成熟度、岗位需求到薪资水平,聊聊这个方向值不值得 all-in。
对比 RT-2、OpenVIA、π0 等 VLA 方案与 DreamerV3、Genie 等世界模型方案,分析两条技术路线在架构设计、数据来源、泛化能力上的核心差异,以及未来融合趋势。
世界模型(world model)当下值不值得投入?作为一个在这个方向摸爬滚打了大半年的工程师,我从技术前景(哪些子问题其实还没有真正解决)、产业需求(哪条产品线是真的在招人、哪些只是发论文)、职业路径(读 PhD、进工业、还是自己造项目)三个维度,给一份尽量不加滤镜的判断。
从传统自动化或后端背景切到强化学习,我自己踩过不少坑:数学没准备够、框架反复横跳、Sim2Real 一上真机就崩。这篇按'数学基础 → 常用框架(Stable-Baselines3 / RLlib / Brax)→ MuJoCo 项目实战 → 通往世界模型与具身智能'的顺序,给一条对软件工程师最省时 …
从世界模型到 VLA,从灵巧手操作到全身运动控制——2026 年具身智能最可能突破的方向在哪里?结合最新论文和产业动态做预判。
从 2018 到 2026,世界模型在泛化能力、Sim-to-Real 迁移、长时预测三个方面始终没有根本性突破。结合最新综述和实践经验,分析瓶颈在哪里、为什么难突破。
是世界模型的风口,但不是所有人的风口。从技术成熟度、落地场景到职业选择,冷静分析 2026 年世界模型方向的真实机会与风险。
深入拆解 Dreamer 系列世界模型的核心组件 RSSM:确定性路径与随机性路径的双轨设计、隐状态预测机制、KL 散度平衡与想象训练,附源码级解读。
从 DreamerV3 到 RSSM,系统解读机器人世界模型的核心概念、技术架构与工程实践,帮你理解 AI 如何从「理解语言」走向「理解世界」。
本科毕业、三年嵌入式经验,能不能转进具身智能?这篇从要补的数学与代码基础、值得跟着复现的开源项目、怎么搭一个能拿得出手的作品集、面试常见考察点,以及什么样的公司和岗位更容易接受转岗者,给一份工程师视角、按季度排的转型路线图。