感知-决策-行动闭环
一句话定义
感知-决策-行动闭环(Perception–Decision–Action Loop)是具身智能的统一操作框架:系统以一定频率持续地"感知环境 → 更新信念 → 做出决策 → 执行动作",并用新感知修正下一轮决策。
为什么重要
- 它是所有具身系统的最大公约数:无论是 PID 控制器、SLAM 导航栈还是 VLA 大模型,都可以映射到这个框架的某一层。
- 频率与延迟的分层设计是机器人系统架构的第一课——读懂任何机器人技术报告,先问"闭环跑在多少 Hz"。
- 端到端(VLA)与分层(LLM+技能库)的路线之争,本质是"把闭环交给一个模型还是拆成多级"。
前置知识
核心概念
一个典型机器人系统的频率分层:
| 层 | 功能 | 典型频率 | 典型实现 |
|---|---|---|---|
| 关节伺服层 | 力矩/位置闭环 | 500~1000 Hz | MCU 上的 PID/电流环 |
| 策略层 | 传感 → 动作映射 | 10~50 Hz | Diffusion Policy、ACT、VLA 动作头 |
| 局部规划层 | 避障、路径跟踪 | 10~30 Hz | MPC、DWA |
| 全局规划层 | 任务分解、路径规划 | 0.1~1 Hz | A*、LLM 任务规划 |
| 认知层 | 语言理解、语义推理 | <1 Hz | VLM / LLM |
两条关键性质:
- 开环 vs 闭环:开环执行预生成动作序列(轨迹重放),不做感知修正;闭环用实时观测修正动作。人类演示是闭环的,简单重放演示是开环的——这是演示数据利用的核心难点。
- 反应延迟(latency):从感知到执行的总延迟决定系统对动态环境的响应能力。延迟过大时机器人像"反应慢半拍的人",追不上移动物体。
原理与机制
为什么必须闭环?因为环境中存在扰动(推挤、滑移、光照变化)与模型误差(动力学参数不准)。闭环利用反馈误差 $e_t = r_{ref} - r_t$ 持续修正,使系统对扰动鲁棒。
为什么必须分层?因为不同子问题的信息量与时间尺度不同:
- 关节层只看编码器/电流,样本短、频率高、必须硬实时;
- 认知层看图像与语言,推理慢、但语义丰富。
端到端路线(如 VLA)试图把策略层与认知层合并:一个模型从图像+语言直接输出动作 token(kp-305)。其优势是端到端优化、泛化好;代价是需要海量数据,且高频控制难以直接由大模型承担——于是 2024 年后的主流设计是双系统(System 1 / System 2):慢速大模型负责语义与规划(System 2,1~10 Hz),快速小模型负责高频动作生成(System 1,50~200 Hz),Figure Helix、NVIDIA GR00T N1 均采用此架构。
公式与图示
┌───────────────────────────────────────────┐
│ 认知层(VLM/LLM, ~1Hz):任务理解与分解 │
└──────────────┬────────────────────────────┘
▼ 子目标/技能调用
┌───────────────────────────────────────────┐
│ 规划层(MPC/路径规划, 10~30Hz):局部决策 │
└──────────────┬────────────────────────────┘
▼ 参考轨迹/目标
┌───────────────────────────────────────────┐
│ 策略层(VLA动作头/RL策略, 10~50Hz) │
└──────────────┬────────────────────────────┘
▼ 关节指令
┌───────────────────────────────────────────┐
│ 伺服层(电流/位置环, 500~1000Hz) │
└───────────────────────────────────────────┘
离散时间闭环的最小形式:$a_t = \pi(o_t)$,$o_{t+1} = f(o_t, a_t) + w_t$,其中 $w_t$ 是环境扰动与传感噪声。闭环的意义:即使 $f$ 有误,$\pi$ 也能在下一拍纠正。
直观类比
- 开车:眼睛看路(感知,~10 Hz 有效刷新)、大脑决定变道(认知,秒级)、手脚打方向(执行,毫秒级)。没人会"想好全部动作再出发"——都是边走边修正。
- 走路时不看脚:步态由小脑闭环维持(无意识高频),路线由大脑决定(有意识低频)——生物界早就用了双系统架构。
实例与案例
- 机械臂抓取:视觉定位(10 Hz)→ 抓取位姿规划(1 Hz)→ 轨迹执行(关节层 1 kHz 闭环)→ 接触后力觉反馈修正(kp-203)。
- 四足机器人爬楼梯:状态估计(kp-105,200 Hz)→ MPC 步态调整(kp-205,50 Hz)→ 关节伺服(1 kHz)。
- Figure Helix(2025):System 2(7B VLM,7~9 Hz)理解场景语言 → System 1( visuomotor 策略,200 Hz)输出上肢动作,全流程跑在机载 GPU 上。
常见误区
- 误区一:频率越高越好。每层只需匹配其物理时间常数;盲提频率只会烧算力。关键是层间接口的延迟可控。
- 误区二:端到端=没有分层。多数"端到端 VLA"仍保留了伺服层,且内部往往有隐式的分层表示(slow/fast 双系统)。
- 误区三:闭环等于闭环回放演示数据。判断闭环与否,看观测是否在执行过程中影响动作,而不是看有没有传感器。
自测题
- 列出五层闭环及各自典型频率;指出你熟悉的一个机器人产品各层大致的实现方式。
- 为什么重放人类演示的开环执行会失败?闭环修正能力从哪来?
- 双系统(System 1/2)设计解决了端到端 VLA 的什么矛盾?
与其他知识点的关系
- kp-203 经典控制与 kp-205 MPC:底层闭环的数学实现。
- kp-305 VLA 与 kp-307 LLM 规划:上层闭环的学习式与符号式实现。
- kp-105 本体感知:感知侧的状态估计是闭环的输入质量保证。
延伸阅读
- Figure AI, Helix: A Vision-Language-Action Model for Generalist Humanoid Control, 2025(双系统架构说明)。
- 教材:Åström & Murray, Feedback Systems(免费在线版)—— 反馈思想的最小充分读物。
本节引用来源
- 经典反馈控制理论
- Figure Helix dual-system design, 2025