感知-决策-行动闭环

入门 基础与全景 kp-003 闭环控制分层架构实时性

一句话定义

感知-决策-行动闭环(Perception–Decision–Action Loop)是具身智能的统一操作框架:系统以一定频率持续地"感知环境 → 更新信念 → 做出决策 → 执行动作",并用新感知修正下一轮决策。

为什么重要

  • 它是所有具身系统的最大公约数:无论是 PID 控制器、SLAM 导航栈还是 VLA 大模型,都可以映射到这个框架的某一层。
  • 频率与延迟的分层设计是机器人系统架构的第一课——读懂任何机器人技术报告,先问"闭环跑在多少 Hz"。
  • 端到端(VLA)与分层(LLM+技能库)的路线之争,本质是"把闭环交给一个模型还是拆成多级"。

前置知识

kp-001 什么是具身智能。

核心概念

一个典型机器人系统的频率分层:

层功能典型频率典型实现
关节伺服层力矩/位置闭环500~1000 HzMCU 上的 PID/电流环
策略层传感 → 动作映射10~50 HzDiffusion Policy、ACT、VLA 动作头
局部规划层避障、路径跟踪10~30 HzMPC、DWA
全局规划层任务分解、路径规划0.1~1 HzA*、LLM 任务规划
认知层语言理解、语义推理<1 HzVLM / LLM

两条关键性质:

  • 开环 vs 闭环:开环执行预生成动作序列(轨迹重放),不做感知修正;闭环用实时观测修正动作。人类演示是闭环的,简单重放演示是开环的——这是演示数据利用的核心难点。
  • 反应延迟(latency):从感知到执行的总延迟决定系统对动态环境的响应能力。延迟过大时机器人像"反应慢半拍的人",追不上移动物体。

原理与机制

为什么必须闭环?因为环境中存在扰动(推挤、滑移、光照变化)与模型误差(动力学参数不准)。闭环利用反馈误差 $e_t = r_{ref} - r_t$ 持续修正,使系统对扰动鲁棒。

为什么必须分层?因为不同子问题的信息量与时间尺度不同:

  • 关节层只看编码器/电流,样本短、频率高、必须硬实时;
  • 认知层看图像与语言,推理慢、但语义丰富。

端到端路线(如 VLA)试图把策略层与认知层合并:一个模型从图像+语言直接输出动作 token(kp-305)。其优势是端到端优化、泛化好;代价是需要海量数据,且高频控制难以直接由大模型承担——于是 2024 年后的主流设计是双系统(System 1 / System 2):慢速大模型负责语义与规划(System 2,1~10 Hz),快速小模型负责高频动作生成(System 1,50~200 Hz),Figure Helix、NVIDIA GR00T N1 均采用此架构。

公式与图示

           ┌───────────────────────────────────────────┐
           │  认知层(VLM/LLM, ~1Hz):任务理解与分解      │
           └──────────────┬────────────────────────────┘
                          ▼ 子目标/技能调用
           ┌───────────────────────────────────────────┐
           │  规划层(MPC/路径规划, 10~30Hz):局部决策     │
           └──────────────┬────────────────────────────┘
                          ▼ 参考轨迹/目标
           ┌───────────────────────────────────────────┐
           │  策略层(VLA动作头/RL策略, 10~50Hz)           │
           └──────────────┬────────────────────────────┘
                          ▼ 关节指令
           ┌───────────────────────────────────────────┐
           │  伺服层(电流/位置环, 500~1000Hz)             │
           └───────────────────────────────────────────┘

离散时间闭环的最小形式:$a_t = \pi(o_t)$,$o_{t+1} = f(o_t, a_t) + w_t$,其中 $w_t$ 是环境扰动与传感噪声。闭环的意义:即使 $f$ 有误,$\pi$ 也能在下一拍纠正。

直观类比

  • 开车:眼睛看路(感知,~10 Hz 有效刷新)、大脑决定变道(认知,秒级)、手脚打方向(执行,毫秒级)。没人会"想好全部动作再出发"——都是边走边修正。
  • 走路时不看脚:步态由小脑闭环维持(无意识高频),路线由大脑决定(有意识低频)——生物界早就用了双系统架构。

实例与案例

  • 机械臂抓取:视觉定位(10 Hz)→ 抓取位姿规划(1 Hz)→ 轨迹执行(关节层 1 kHz 闭环)→ 接触后力觉反馈修正(kp-203)。
  • 四足机器人爬楼梯:状态估计(kp-105,200 Hz)→ MPC 步态调整(kp-205,50 Hz)→ 关节伺服(1 kHz)。
  • Figure Helix(2025):System 2(7B VLM,7~9 Hz)理解场景语言 → System 1( visuomotor 策略,200 Hz)输出上肢动作,全流程跑在机载 GPU 上。

常见误区

  • 误区一:频率越高越好。每层只需匹配其物理时间常数;盲提频率只会烧算力。关键是层间接口的延迟可控。
  • 误区二:端到端=没有分层。多数"端到端 VLA"仍保留了伺服层,且内部往往有隐式的分层表示(slow/fast 双系统)。
  • 误区三:闭环等于闭环回放演示数据。判断闭环与否,看观测是否在执行过程中影响动作,而不是看有没有传感器。

自测题

  1. 列出五层闭环及各自典型频率;指出你熟悉的一个机器人产品各层大致的实现方式。
  2. 为什么重放人类演示的开环执行会失败?闭环修正能力从哪来?
  3. 双系统(System 1/2)设计解决了端到端 VLA 的什么矛盾?

与其他知识点的关系

延伸阅读

  • Figure AI, Helix: A Vision-Language-Action Model for Generalist Humanoid Control, 2025(双系统架构说明)。
  • 教材:Åström & Murray, Feedback Systems(免费在线版)—— 反馈思想的最小充分读物。

本节引用来源

  • 经典反馈控制理论
  • Figure Helix dual-system design, 2025