Sim2Real 与域随机化
一句话定义
Sim2Real 研究如何把仿真中训练的策略迁移到真实机器人:现实差距(reality gap)来自动力学、感知与延迟三方面,域随机化、系统辨识、教师-学生蒸馏与 real2sim 是四大标准武器。
为什么重要
- 它是"仿真数据工厂"与"真机部署"之间唯一的桥;没有这套方法,kp-401 的吞吐量再大也没有意义。
- locomotion 证明 Sim2Real 可以工程化成功(四足跑山、人形行走),但接触丰富的操作仍是最难啃的部分——知道边界才能正确押注。
- 面试与论文评审的高频考点:一句"我们在仿真里跑通了"必须能接一句"怎么迁移的"。
前置知识
kp-401 仿真、kp-206 RL、kp-105 状态估计。
核心概念
现实差距三来源:
- 动力学差距:摩擦、质量、关节柔性、执行器响应与仿真模型不符。
- 感知差距:渲染图像与真实相机的纹理、光照、噪声分布不同;深度相机噪声模式不同。
- 系统差距:控制延迟、通信抖动、时序不同步(最易被忽略,杀伤力最大)。
域随机化(Domain Randomization, DR):与其把仿真调得"像"现实,不如把仿真调得"足够多样",让现实成为随机分布中普通的一例,策略自然泛化过去。
- 视觉 DR(Tobin et al. 2017):随机纹理、光照、相机位姿、干扰物——真机图像落在训练分布内。
- 动力学 DR(Peng et al. 2018):随机质量/摩擦/PD 增益/延迟——训练出"对参数不敏感"的鲁棒控制。
教师-学生(特权蒸馏):教师用仿真才有的特权信息(真实摩擦系数、地形高度图)学好;学生模仿教师但只用真机可得观测——把"不可知"转成"可从历史推断"(kp-206)。
Real2Sim:反方向迁移——用真实扫描/拍摄(3D 扫描、NeRF/3DGS、视频)重建高保真仿真场景,先"把现实搬进仿真"再训练;VLA 的合成数据管线大量采用此法。
原理与机制
为什么随机化有效(直觉+理论):训练分布覆盖越大,策略对特定参数的"过拟合"越小;当真实参数落在训练分布内,零样本迁移成为可能。代价是随机化过强会拉低仿真内的绝对性能——随机化强度是泛化-性能的旋钮。
标准迁移清单(locomotion 实战顺序):
① 执行器建模:电机+减速器响应曲线 / 执行器网络
② 延迟建模:动作延迟 + 观测延迟注入
③ 观测噪声:与真机估计器一致的噪声([kp-105])
④ 动力学 DR:质量/质心/摩擦/PD 增益
⑤ 课程学习:从易到难逐渐放开随机范围
⑥ 部署保护:输出限幅、看门狗、急停
操作任务为何更难:接触模式离散跳变(滑/粘、断/合)让动力学 DR 难以覆盖;视觉 DR 又难以覆盖真实桌面的无限纹理。当前主流解法混合:少量真机演示微调(IL)+ 仿真预训练,或 real2sim 高保真重建。
公式与图示
DR 的训练目标可视为在参数分布上的期望性能最大化:
$\boldsymbol{\xi}$ 为随机化的动力学/视觉参数。$p(\boldsymbol{\xi})$ 的范围要覆盖真机参数——这本身就是一次"参数不确定性的工程估计"。
仿真参数空间(随机化覆盖) 真实系统落点
┌────────────────────────┐
│ ░░░░░░░░░░░░░░░░░░░░░ │
│ ░░░░░░░░░░░░░░░░░░░░░ │ ★ = 你的真机(未知具体值)
│ ░░░░░░░░░░░░░░░░░░░░░ │
└────────────────────────┘
只要 ★ 落在 ░ 内,策略不需要知道确切参数也能工作
直观类比
- 全天候训练的运动员:只在标准田径场练(确定性仿真)的选手,遇到雨天就废;什么天气都练过(DR)的选手,比赛日什么条件都稳。
- 考纲内蒙题 vs 真懂:把仿真调到与真机一模一样=背考纲,真题稍变就崩;随机化=理解原理,考什么都行。
实例与案例
- OpenAI Dactyl(2018-19):极致视觉+动力学 DR 训练机械手转魔方,零样本上真机——DR 可行性的高调证明,也展示了成本(万级 CPU/GPU 小时)。
- ETH ANYmal / Unitree:执行器网络 + DR + 教师学生 → 真机爬楼梯、抗踹;几乎所有 RL locomotion 论文的标配方法节。
- π0 / GR00T 合成数据:用 real2sim 重建场景批量生成演示(万级小时),真机演示只提供"锚点"——Sim2Real 正在被用作 VLA 的数据放大器(kp-406)。
常见误区
- 误区一:随机化越多越好。过度随机化=平均化了策略,仿真内性能崩塌且真机也不见得稳;应基于真机参数的先验范围设定。
- 误区二:视觉 DR 解决感知差距就够了。延迟与动力学差距不建模,视觉迁移得再好也抓不准。
- 误区三:Sim2Real 已被解决。locomotion 层面接近工程成熟;接触丰富操作与可变形物体仍是开放问题,"零样本操作迁移"论文通常有大量隐藏条件。
自测题
- 列出四类现实差距,并为每类指定一种标准对策。
- 为什么教师-学生蒸馏能绕开"真机拿不到特权信息"的问题?
- 你的策略真机上"手抖、追不上目标",仿真中表现良好——最可能缺了哪些建模?
与其他知识点的关系
- kp-401 仿真:差距的来源侧。
- kp-306 世界模型:可学习的仿真器是 Sim2Real 的另一条路径。
- kp-105 状态估计:观测噪声建模的依据。
延伸阅读
- Tobin et al., Domain Randomization for Transferring Deep NNs, IROS 2017;Peng et al., Sim-to-Real Transfer of Robotic Control with Dynamics Randomization, ICRA 2018。
- 综述:Zhou et al., Sim-to-Real Transfer in Deep Reinforcement Learning for Robotic Manipulation: A Survey, IEEE TNNLS(2023 前后多篇综述可选其一精读)。
- legged_gym 仓库的 cfg 参数注释——一份"该随机化什么"的工程清单。
本节引用来源
- Tobin et al., Domain Randomization, 2017
- Peng et al., Dynamics Randomization, 2018