ACT 与 ALOHA:精细操作的开源范式

进阶 学习范式 kp-304 ACTALOHA动作分块CVAE遥操作

一句话定义

ALOHA(2023)用约 2 万美元的低成本双臂遥操作硬件 + ACT(Action Chunking with Transformers)策略,让双臂机器人学会系鞋带级的精细操作;Mobile ALOHA(2024)加上移动底盘后,成为全球实验室复刻最多的数据采集+学习范式。

为什么重要

  • 把"精细操作数据采集"的价格打下来了:此前灵巧操作数据只有大厂实验室玩得起;ALOHA 开源后全球高校、个人都能采数据、训策略、发论文。
  • ACT 的两个机制——动作分块、CVAE 风格变量——已成为操作策略的通用组件。
  • 它示范了"硬件开源 + 数据采集 + 学习算法"三位一体的社区化模式,直接启发了 LeRobot/SO-100 生态(kp-403)。

前置知识

kp-301 模仿学习;Transformer 基础。

核心概念

ALOHA 硬件:4 个低成本机械臂(2 leader 遥操作臂 + 2 follower 执行臂),3D 打印件 + 舵机/电机,总成本约 2 万美元;操作者像"操纵木偶"一样带动 leader 臂,follower 臂同步执行并记录。提供力反馈(follower 的反作用可传回手上),这是精细操作演示质量的秘密。

ACT(Action Chunking with Transformers):

  1. 动作分块:一次预测未来 k 步(如 k=100,控制 50 Hz 时即 2 秒)动作序列,执行其中约一半,避免每步都预测带来的抖动与误差累积。
  2. CVAE 风格变量 z:演示者风格各异(同任务不同手法),把"本次演示的整体风格"编码为潜变量 z 作为条件,训练时 z 来自编码器,推理时 z=0 取均值风格——解决多模态与数据不一致。
  3. 时序集成(temporal ensembling):多个历史预测对当前步的输出加权平均,进一步平滑。

Mobile ALOHA(2024):ALOHA 装到轮式底盘上 + 共训(移动操作数据 + 静态操作数据),完成炒菜、电梯按键、洗衣等全屋任务 demo,YouTube 播放量千万级——把"移动操作"从大厂专利变成校园项目。

原理与机制

ACT 架构:

图像(4机位)+ 关节状态
   ├─ CVAE 编码器:整条轨迹 → z(风格潜变量)   [仅训练时]
   └─ Transformer 解码器:观测 tokens (+z) → k 步动作块
推理:z=0,每次前向出 k 步,执行 h≈k/2 步,再观测重推

为什么动作分块抑制漂移(kp-301):单步模式每步都在"分布边缘"重新决策,小误差逐步放大;块模式一次规划出连贯段,中间不再有决策点,执行段内的误差被"惯性"平滑掉。分块过长的代价是反应迟钝,k/h 是响应性-稳定性的权衡。

数据配方(原论文消融):50 条演示即可达到较好成功率;4 个相机比 1 个显著更好;力反馈遥操作(ALOHA)比无力反馈采集的演示质量高、训练结果好。

公式与图示

CVAE 目标(简化):$\mathcal{L} = \|\mathbf{A}^k - \hat{\mathbf{A}}^k(\mathbf{o}, z)\|^2 + \beta\, D_{KL}(q(z|\mathbf{A}^k, \mathbf{o}) \| p(z))$

第一项重构动作块,第二项正则潜空间。推理时 $z = \mu$(或 0)。

leader(人手) ══同步══► follower(机器人)     ALOHA 采集
     │                        │
     └────► (o_t, a_t) 演示对 ─┴──► ACT 训练 ──► follower 自主执行

直观类比

  • 驾校教练的双方向盘:ALOHA 的 leader-follower 就是教练车的副驾方向盘——学员(机器人)执行,教练(人)随时手感纠偏,演示里自然带着"纠偏"这个最宝贵的信息。
  • 风格变量 z:像"每个厨师炒同一道菜的手法指纹"。让模型显式承认"手法有流派",而不是强行平均成四不像。

实例与案例

  • ALOHA 论文任务:系鞋带(辅助)、午餐盒盖开合、纽扣电池插入、胶带切割——精细双臂操作的成功率随分块与 CVAE 显著提升。
  • Mobile ALOHA 任务:炒虾、洗碗机装载、乘坐电梯(按楼层)——社区复刻中成功率分布不均,也暴露了该范式对场景变化敏感的短板。
  • 生态延伸:Hugging Face LeRobot 把 ALOHA/SO-100 纳入标准硬件清单;UMI(kp-403)提供了"无需机器人"的替代采集路线。

常见误区

  • 误区一:demo 视频里的成功率=你的复现成功率。原演示是同场景同物品反复训练的结果;换场景/物品/光照性能骤降——评估时必须做扰动测试。
  • 误区二:ACT 只配 ALOHA 用。ACT 是通用模仿学习策略结构,单臂、移动底盘、人形上半身都可套用。
  • 误区三:数据便宜所以多采就行。ALOHA 数据采集很耗人力(一条 30 秒任务演示约需 2~5 分钟含重置);kp-406 的自动化扩增因此重要。

自测题

  1. 动作分块为什么能抑制误差累积?分块过长会牺牲什么?
  2. CVAE 的 z 建模了什么?推理时为什么常取 z=0?
  3. 若你的任务演示者风格高度一致,CVAE 项还重要吗?为什么?

与其他知识点的关系

延伸阅读

  • Zhao, Kumar, Levine & Finn, Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware, RSS 2023(ALOHA+ACT)。
  • Fu et al., Mobile ALOHA, 2024。
  • LeRobot 文档:ACT 训练与 ALOHA 硬件装配指南。

本节引用来源

  • Zhao et al., ALOHA & ACT, 2023
  • Fu et al., Mobile ALOHA, 2024