强化学习运动控制
一句话定义
强化学习运动控制把"怎么走、怎么抓"写成奖励函数,在 GPU 并行仿真中让策略与数万个环境交互试错,训练出对真实世界鲁棒的运动/操作策略,再经域随机化迁移到真机。
为什么重要
- 它是 2019 年以来足式机器人最大的范式变化:ETH、Unitree、多数人形公司的步态层已由 RL 主导,效果(自然步态、复杂地形、抗扰)超过手工方法。
- 训练方法论(并行仿真、课程学习、教师-学生、执行器网络)已成为具身智能工程师的标配技能。
- 它是 Sim2Real 最成功的应用领域——理解它 = 理解 kp-402 的实战形态。
前置知识
kp-302 深度 RL、kp-204 步态控制、kp-401 仿真。
核心概念
任务形式化:MDP 状态 = 命令速度 + 本体观测(kp-105),动作 = 关节位置/力矩目标,奖励 = 速度跟踪项 - 各类惩罚项。
并行仿真训练(Isaac Gym, 2021 / Isaac Lab、legged_gym、rsl_rl):单张 GPU 同时运行数千个环境 + 策略前向,训练时间从天级降到分钟~小时级(Rudin 2021: "Learning to Walk in Minutes")。这是 RL locomotion 爆发的直接技术原因。
奖励设计(最难也最核心的工程):
- 主奖励:线速度/角速度跟踪误差(负指数);
- 惩罚:能量、关节加速度/力矩突变、足底打滑、躯体碰撞、姿态偏离、动作变化率。
- 陷阱:奖励项互相冲突,权重即"步态性格";写不好出现鬼步、抖动、原地自杀式翻滚(kp-302 奖励欺骗)。
域随机化 + 课程:随机化质量/摩擦/延迟/PD 增益/地形,随训练进度加难(课程学习),逼出鲁棒策略。
教师-学生(特权学习):教师策略看"特权信息"(真实摩擦、外力、地形高度图)在仿真中学好;学生策略只看真机可得观测(本体+本体历史)蒸馏模仿——把不可观测的信息蒸馏进历史记忆(Lee et al., Science Robotics 2020;Miki et al. 2022)。
执行器网络(Actuator Net):用神经网络建模电机+减速器的真实动态(Hwangbo 2019),替代理想 PD 模型,显著缩小 Sim2Real 差距。
原理与机制
训练循环:
GPU 上 4096+ 并行环境
每步:策略 π(a|o) ─► 仿真物理步进 ─► 奖励/终止判定 ─► PPO 更新
地形课程:平地 → 崎岖 → 台阶 → 独木桥(按表现晋级)
随机化:质量 ±10%、摩擦 0.3~1.25、控制延迟 0~20ms、推搡扰动
部署:策略导出(ONNX/TensorRT)─► 机载推理(50Hz)─► 关节层 PD 跟踪
为什么学出来的步态"更活":优化过程自动发现利用身体动力学(摆臂平衡、足弓储能)的解,人类工程师很难手工设计到那个程度——这正是形态计算(kp-005)被优化器自动挖掘。
观测设计原则:只用真机可得量(编码器、IMU、指令);加动作历史 = 隐式状态估计器。仿真中要注入与真机一致的观测噪声与延迟(kp-402)。
公式与图示
locomotion 奖励的典型形式:
PPO 目标(详见 kp-302):重要性采样比裁剪的代理目标 $\min(r_t(\theta)\hat{A}_t, \text{clip}(r_t(\theta), 1\pm\epsilon)\hat{A}_t)$。
真机观测 o_t ─► π_θ(MLP, ~2层256)─► 关节位置目标 ─► PD ─► 电机
▲ │
└────────── 编码器/IMU(200Hz)◄──── 机器人本体 ◄─────────┘
直观类比
- 学骑自行车:摔(负奖励)与前进(正奖励)训练出平衡直觉;没人给你解析解——RL 也是"摔出来的技能"。
- 考试刷题:并行仿真=无限套模拟卷;课程学习=从易到难;域随机化=考卷故意加噪,逼你掌握真功夫而非背题。
实例与案例
- ANYmal 进化史:2019 Science Robotics(执行器网络+RL 快走)→ 2022(教师学生,盲走崎岖地形)→ 2023 Parkour(跑酷跳跃)——RL locomotion 的完整参考系。
- Unitree Go2/H1 开源生态:legged_gym、Isaac Lab、MuJoCo Playground 使个人 GPU 一天内训出可部署策略。
- 机械臂 RL:QT-Opt(2018,抓取)、TossingBot(2019,抛掷)、旋转物体(OpenAI/Google 系列)——RL 操作因样本与安全问题比 locomotion 更难(kp-302),当前主流仍是模仿学习+仿真 RL 微调。
常见误区
- 误区一:RL=不需要动力学知识。奖励、课程、观测、终止条件的设计全是动力学先验;不懂物理的人调不出好 locomotion。
- 误区二:仿真里成功=真机能用。没做域随机化/延迟建模/执行器建模的"仿真 100%"到真机大概率瘫痪(kp-402)。
- 误区三:安全靠奖励惩罚兜底。部署必须保留硬件安全层(速度/力矩限幅、碰撞检测、急停),策略层不可作为唯一安全机制(kp-603)。
自测题
- 设计一个"双足原地踏步"的奖励函数,列出至少 5 个惩罚项及理由。
- 教师-学生范式中,学生如何"看到"教师才有的特权信息?
- 为什么 locomotion 的 Sim2Real 比操作更容易成功?
与其他知识点的关系
- kp-302 深度 RL:算法基础(PPO/SAC)。
- kp-401/402 仿真与 Sim2Real:训练与迁移的基础设施。
- kp-204 步态/WBC:被 RL 部分替代的对照组;现代系统常 RL+WBC 混合。
延伸阅读
- Rudin, Hoeller, Reist & Hutter, Learning to Walk in Minutes Using Massively Parallel RL, CoRL 2021(legged_gym)。
- Lee, Hwangbo, Wellhausen, Koltun & Hutter, Learning Quadrupedal Locomotion over Challenging Terrain, Science Robotics 2020。
- Isaac Lab 官方文档 + legged_gym 仓库(动手路线)。
本节引用来源
- Rudin et al., Learning to Walk in Minutes, CoRL 2021
- Hwangbo et al., Science Robotics 2019