遥操作与数据采集
一句话定义
遥操作(teleoperation)让人用直觉设备直接操纵机器人并记录 (观测, 动作) 对,是当前高质量操作演示数据的第一来源;围绕"更便宜、更快、更自然"的采集硬件演化(ALOHA → UMI → VR → 自动扩增)直接决定了模仿学习的上限。
为什么重要
- kp-301 告诉我们 IL 吃数据——但数据从哪来?在数据飞轮成熟前(kp-406),人类演示仍是起步阶段的主食。
- 数据质量 > 算法精巧:同一算法,好演示与坏演示的成功率可以差 30 个百分点;采集协议是最被低估的工程环节。
- 采集硬件的每次降本(ALOHA 2 万美元、SO-100 数百美元)都直接扩大了"能做机器人学习"的人群半径。
前置知识
核心概念
采集方式谱系:
| 方式 | 代表 | 成本 | 特点 |
|---|---|---|---|
| leader-follower 双臂 | ALOHA | ~$20k | 力反馈、双臂精细;操作像牵木偶 |
| 手持夹具(无机器人) | UMI (2024) | ~$500 级 | GoPro+夹持器手持采集,SLAM 恢复轨迹;在野环境随意采 |
| VR 遥操作 | Meta Quest + 机制臂 | 中 | 沉浸式、直觉,双臂/人形通用(GR00T 数据管线采用) |
| 关节空间外骨骼 | AirExo 等 | 中低 | 穿戴式,天然人形构型 |
| 空间鼠标/键盘 | 实验室常见 | 极低 | 简单但慢,适合单臂粗糙任务 |
| 自动扩增 | MimicGen / RoboCasa | 软件成本 | 少量人演示 → 程序化生成数千条(见下) |
演示质量的六个维度:操作一致性(同一手法)、时序对齐精度(视觉与动作时间戳)、视角覆盖(多相机)、覆盖多样性(物体位姿/干扰)、成功率(失败的演示要么修复要么标注)、人机工效(采集员 8 小时后的手感与耐心)。
时延与柔顺:遥操作系统的延迟直接影响演示质量——高延迟下人类会"提前动作"或"过冲",这些瑕疵会被策略学走。ALOHA 的力反馈让操作者像拿自己手一样操作,是质量的关键。
原理与机制
ALOHA 数据链路:leader 臂编码器(人手位姿)→ 映射为 follower 关节目标 → follower 执行并记录(关节+4 相机 50Hz)。数据即模仿学习的 (o, a) 监督对。
UMI 的巧思:不通过机器人采集,直接手持"带相机的夹持器"完成任务的真人体感演示;离线用 ORB-SLAM3 从视频恢复手腕轨迹(kp-103),再结合延迟感知推理部署到任意臂上。意义:数据采集与机器人硬件解耦,演示成本骤降、环境多样性暴涨。
MimicGen(2023):输入约 50 条人演示,按物体位姿自动变换重定向机器人轨迹,生成 5 万条新演示(RoboCasa 用它生成 12 万+)。本质:演示的动作片段 + 观测重渲染,成功率约 90% 且策略质量不降。它把"数据采集"从人力问题变成了"一次高质量演示 + 程序化扩展"。
自动重置:演示采集最耗时的往往是"把场景摆回初始状态";并行采集站、自重置策略、可复位场景设计都是吞吐量关键。
公式与图示
人力演示(50 条) MimicGen 自动扩增
人演示 ──► 分段动作原语 ┌──────────────────┐
│ │ │ 新物体位姿 × 原语 │
│ ▼ │ →重定向→ 执行验证 │ ×1000
│ 场景随机化 └──────────────────┘
▼ │
成功演示集 ◄────────────────────────┘
▼
训练(ACT / Diffusion Policy / VLA 微调)
一条可用演示的最低要求:任务成功 + 时间戳对齐(视觉/动作 <1 帧偏差)+ 无采集事故(卡顿、丢帧、误触发)。
直观类比
- 学书法要临帖:演示数据是"字帖"——字帖的质量(是否大师手笔、印刷是否走样)直接决定你能学多好。ALOHA 是高清字帖,UMI 是"在真山真水里看大师写字"。
- MimicGen = 活字印刷:好字帖写一个字,排版系统把字印到一万张不同格式的纸上。
实例与案例
- ALOHA 采集实测:一条 30 秒精细任务,含重置通常 3~5 分钟;熟练采集员一天产出 100~200 条——人力成本是当前操作数据集规模的上限约束。
- UMI 复现潮(2024-25):因为设备便宜,高校用它采集"挂衣服、浇花、抓活鱼"等真野任务,论文产出密集。
- VLA 公司的数据工厂:Physical Intelligence、Figure 建立数十至上百个采集工位 + 自动重置 + VR 遥操,目标是"每小时数百条干净演示"的工业流水线。
常见误区
- 误区一:演示数量万能。100 条一致的演示好过 500 条手法混乱的演示;先定采集协议(手法 SOP、重置标准、成功判定)再加量。
- 误区二:忽略时间戳。相机与动作流不同步 50ms,学到的策略就带 50ms 系统性延迟——所有采集系统必须做硬件级或软件级同步校准。
- 误区三:采集环境越干净越好。全在"理想桌面"采的数据,策略只会在理想桌面工作;刻意加入位姿/光照/干扰物变化(在合理范围内)是免费的泛化增益。
自测题
- 对比 ALOHA 与 UMI 采集路线在成本、质量、适用任务上的取舍。
- MimicGen 为什么能从 50 条演示扩增出 5 万条而不引入系统性错误?
- 设计一份"双臂叠毛巾"的采集 SOP:包括手法、机位、重置、成功判定。
与其他知识点的关系
- kp-304 ALOHA:采集硬件标杆的细节。
- kp-404 数据集:采集结果的规模化汇流。
- kp-406 数据飞轮:人力采集如何过渡到自动化闭环。
延伸阅读
- Chi et al., Universal Manipulation Interface, RSS 2024(项目页含装配指南)。
- Mandelkar et al., MimicGen, 2023;Nasiriany et al., RoboCasa, 2024。
- LeRobot 文档:SO-100 采集教程(个人实践最低成本路径)。
本节引用来源
- Zhao et al., ALOHA, 2023
- Chi et al., UMI, 2024
- Mandelkar et al., MimicGen, 2023