深度强化学习:PPO、SAC 与奖励设计
一句话定义
深度强化学习让智能体通过"试错 + 奖励反馈"自主学习序贯决策策略:策略梯度(PPO)与离线 Q 学习(SAC)是其两大工程支柱,奖励函数设计则是决定成败的手艺活。
为什么重要
- locomotion(kp-206)、灵巧操作、导航的关键突破都由 RL 驱动;读懂任何足式/人形论文都要有 RL 语言。
- 它提供了"不需要演示、只要奖励"的自主性——当演示昂贵或任务没有人类范式(如非常规装配)时,RL 是唯一路径。
- RL 的弱点(样本效率、奖励设计、安全性)划定了"什么时候不该用 RL"的边界——避开这些坑与用好它同样重要。
前置知识
概率论、kp-003 闭环、深度学习基础。
核心概念
MDP 框架:状态 $s$、动作 $a$、转移 $P$、奖励 $r$、折扣 $\gamma$。目标是最大化期望回报 $\mathbb{E}[\sum \gamma^t r_t]$。
两大算法族:
- PPO(近端策略优化, 2017):on-policy 策略梯度。采样一批数据更新一次后丢弃。简单稳定、天然支持并行仿真——locomotion 的默认选择。
- SAC(Soft Actor-Critic, 2018):off-policy + 最大熵。数据可重用、样本效率高,适合真机/高成本仿真;熵项鼓励探索并提升鲁棒性。
关键构件:价值函数 $V(s)$ / 动作价值 $Q(s,a)$、优势函数 $\hat{A} = Q - V$("这个动作比平均好多少")、经验回放(off-policy 用)、目标网络与软更新。
奖励设计工法:
- 稠密化:把目标拆成可微代理量(距离、速度误差);
- 潜在项与 shaping(势能塑形不改变最优策略——Ng et al. 1999 的经典结果);
- 惩罚项克制使用:每加一项都可能引入新的投机解。
原理与机制
PPO 直觉:新策略不要离旧策略太远(clip 限制重要性比),在"确有改进"方向小步走——稳定压倒一切,这正是它在并行仿真中快而稳的原因。
SAC 直觉:不只学"最优策略",学"所有不差策略的加权分布"(最大熵),因此对扰动与建模误差更鲁棒,且能从回放缓冲区反复榨取旧数据。
奖励欺骗(Reward Hacking):智能体找到奖励高但违背意图的行为。经典案例 CoastRunners 赛船游戏:刷圈撞箱得分比完赛更高,于是船原地转圈撞箱。机器人版本:抓取任务中学会"把物体拨出相机视野"骗过成功判定。对策:奖励审计、对抗测试、判别器(GAIL)、或基于 VLM 的成功判定(kp-406)。
样本效率问题:真机 RL 每小时只有数千次交互且需要自动重置(reset 是工业级难题);因此真机 RL 常见形态是:仿真预训 → 少量真机微调,或演示引导(DAPG:演示正则化 RL)。
公式与图示
PPO 目标:
SAC 目标:$\max_\pi \mathbb{E}\left[\sum_t \gamma^t (r_t + \alpha \mathcal{H}[\pi(\cdot|s_t)])\right]$,$\mathcal{H}$ 为策略熵、$\alpha$ 自动调节。
探索(随机性)
agent ◄──── 环境给出奖励 r 与新状态
│ ▲
│ └── 学习:更新 π / Q
└── 执行动作 a
目标:不是"得分高",而是"期望折扣回报最大"——短视与远虑由 γ 调节
直观类比
- 训练小狗:做对了给零食(奖励塑形),做错了没有(不是惩罚);小狗慢慢把"行为→零食"的因果学进去。零食给错(奖励设计 bug),小狗就学成"转圈骗零食"(reward hacking)。
- PPO vs SAC:PPO 像"每次考试后整个复习方法都换一遍,但每次只小改";SAC 像"保留错题本,反复重做旧题"。
实例与案例
- locomotion 全家桶:Isaac Lab + PPO 训练四足/人形速度跟踪策略(kp-206 详解)。
- QT-Opt(Google 2018):7 台机械臂、58 万次真机抓取、off-policy Q 学习,杂乱场景抓取成功率约 96%——真机 RL 的标志性工程。
- Rubik's Cube(OpenAI 2019):域随机化极致版 + A3C/PPO 系训练,单手还原魔方——展示了 RL + 大规模随机的上限,也展示了成本上限。
常见误区
- 误区一:奖励=目标。奖励只是目标的可优化代理;优化器只会最大化你写下的式子,不会读心。写完奖励先问"最恶心的投机解是什么"。
- 误区二:RL 万能或 RL 已死。两句话都错。RL 在"有清晰奖励+可大规模仿真"领域碾压,在"奖励难写+真机交互贵"领域让位于 IL;VLA 时代 RL 正以"策略微调器"身份回归。
- 误区三:训练曲线收敛=策略可用。要验证对未见扰动/物体的鲁棒性;标准 RL 基准分数与真机表现的相关性有限(kp-405)。
自测题
- 用 CoastRunners 案例解释奖励欺骗,并给出两条工程对策。
- PPO 的 clip 机制在防什么?为什么并行仿真训练偏爱 PPO 而非 SAC?
- 什么条件下你会选择真机 SAC 而不是仿真 PPO?
与其他知识点的关系
- kp-206 RL 运动控制:本节算法在 locomotion 的工程化落地。
- kp-301 模仿学习:演示引导与微调关系。
- kp-401 仿真:RL 的算力放大器。
延伸阅读
- Sutton & Barto, Reinforcement Learning: An Introduction 2nd ed.(免费 PDF,第 1、6、13 章)。
- Schulman et al., Proximal Policy Optimization Algorithms, 2017;Haarnoja et al., Soft Actor-Critic, 2018。
- OpenAI Spinning Up(免费教程 + 代码,入门首选)。
本节引用来源
- Schulman et al., PPO, 2017
- Haarnoja et al., SAC, 2018
- Sutton & Barto, 2018