遥操作与数据采集

核心 数据、仿真与评估 kp-403 遥操作ALOHAUMI数据采集演示质量

一句话定义

遥操作(teleoperation)让人用直觉设备直接操纵机器人并记录 (观测, 动作) 对,是当前高质量操作演示数据的第一来源;围绕"更便宜、更快、更自然"的采集硬件演化(ALOHA → UMI → VR → 自动扩增)直接决定了模仿学习的上限。

为什么重要

  • kp-301 告诉我们 IL 吃数据——但数据从哪来?在数据飞轮成熟前(kp-406),人类演示仍是起步阶段的主食。
  • 数据质量 > 算法精巧:同一算法,好演示与坏演示的成功率可以差 30 个百分点;采集协议是最被低估的工程环节。
  • 采集硬件的每次降本(ALOHA 2 万美元、SO-100 数百美元)都直接扩大了"能做机器人学习"的人群半径。

前置知识

kp-304 ALOHA/ACT、kp-101 传感器。

核心概念

采集方式谱系:

方式代表成本特点
leader-follower 双臂ALOHA~$20k力反馈、双臂精细;操作像牵木偶
手持夹具(无机器人)UMI (2024)~$500 级GoPro+夹持器手持采集,SLAM 恢复轨迹;在野环境随意采
VR 遥操作Meta Quest + 机制臂中沉浸式、直觉,双臂/人形通用(GR00T 数据管线采用)
关节空间外骨骼AirExo 等中低穿戴式,天然人形构型
空间鼠标/键盘实验室常见极低简单但慢,适合单臂粗糙任务
自动扩增MimicGen / RoboCasa软件成本少量人演示 → 程序化生成数千条(见下)

演示质量的六个维度:操作一致性(同一手法)、时序对齐精度(视觉与动作时间戳)、视角覆盖(多相机)、覆盖多样性(物体位姿/干扰)、成功率(失败的演示要么修复要么标注)、人机工效(采集员 8 小时后的手感与耐心)。

时延与柔顺:遥操作系统的延迟直接影响演示质量——高延迟下人类会"提前动作"或"过冲",这些瑕疵会被策略学走。ALOHA 的力反馈让操作者像拿自己手一样操作,是质量的关键。

原理与机制

ALOHA 数据链路:leader 臂编码器(人手位姿)→ 映射为 follower 关节目标 → follower 执行并记录(关节+4 相机 50Hz)。数据即模仿学习的 (o, a) 监督对。

UMI 的巧思:不通过机器人采集,直接手持"带相机的夹持器"完成任务的真人体感演示;离线用 ORB-SLAM3 从视频恢复手腕轨迹(kp-103),再结合延迟感知推理部署到任意臂上。意义:数据采集与机器人硬件解耦,演示成本骤降、环境多样性暴涨。

MimicGen(2023):输入约 50 条人演示,按物体位姿自动变换重定向机器人轨迹,生成 5 万条新演示(RoboCasa 用它生成 12 万+)。本质:演示的动作片段 + 观测重渲染,成功率约 90% 且策略质量不降。它把"数据采集"从人力问题变成了"一次高质量演示 + 程序化扩展"。

自动重置:演示采集最耗时的往往是"把场景摆回初始状态";并行采集站、自重置策略、可复位场景设计都是吞吐量关键。

公式与图示

       人力演示(50 条)              MimicGen 自动扩增
   人演示 ──► 分段动作原语            ┌──────────────────┐
      │          │                 │ 新物体位姿 × 原语  │
      │          ▼                 │ →重定向→ 执行验证  │ ×1000
      │     场景随机化              └──────────────────┘
      ▼                                │
   成功演示集 ◄────────────────────────┘
      ▼
   训练(ACT / Diffusion Policy / VLA 微调)

一条可用演示的最低要求:任务成功 + 时间戳对齐(视觉/动作 <1 帧偏差)+ 无采集事故(卡顿、丢帧、误触发)。

直观类比

  • 学书法要临帖:演示数据是"字帖"——字帖的质量(是否大师手笔、印刷是否走样)直接决定你能学多好。ALOHA 是高清字帖,UMI 是"在真山真水里看大师写字"。
  • MimicGen = 活字印刷:好字帖写一个字,排版系统把字印到一万张不同格式的纸上。

实例与案例

  • ALOHA 采集实测:一条 30 秒精细任务,含重置通常 3~5 分钟;熟练采集员一天产出 100~200 条——人力成本是当前操作数据集规模的上限约束。
  • UMI 复现潮(2024-25):因为设备便宜,高校用它采集"挂衣服、浇花、抓活鱼"等真野任务,论文产出密集。
  • VLA 公司的数据工厂:Physical Intelligence、Figure 建立数十至上百个采集工位 + 自动重置 + VR 遥操,目标是"每小时数百条干净演示"的工业流水线。

常见误区

  • 误区一:演示数量万能。100 条一致的演示好过 500 条手法混乱的演示;先定采集协议(手法 SOP、重置标准、成功判定)再加量。
  • 误区二:忽略时间戳。相机与动作流不同步 50ms,学到的策略就带 50ms 系统性延迟——所有采集系统必须做硬件级或软件级同步校准。
  • 误区三:采集环境越干净越好。全在"理想桌面"采的数据,策略只会在理想桌面工作;刻意加入位姿/光照/干扰物变化(在合理范围内)是免费的泛化增益。

自测题

  1. 对比 ALOHA 与 UMI 采集路线在成本、质量、适用任务上的取舍。
  2. MimicGen 为什么能从 50 条演示扩增出 5 万条而不引入系统性错误?
  3. 设计一份"双臂叠毛巾"的采集 SOP:包括手法、机位、重置、成功判定。

与其他知识点的关系

延伸阅读

  • Chi et al., Universal Manipulation Interface, RSS 2024(项目页含装配指南)。
  • Mandelkar et al., MimicGen, 2023;Nasiriany et al., RoboCasa, 2024。
  • LeRobot 文档:SO-100 采集教程(个人实践最低成本路径)。

本节引用来源

  • Zhao et al., ALOHA, 2023
  • Chi et al., UMI, 2024
  • Mandelkar et al., MimicGen, 2023