开源数据集生态

核心 数据、仿真与评估 kp-404 Open X-EmbodimentDROID数据格式跨具身

一句话定义

开源机器人数据集(Open X-Embodiment、DROID、BridgeData 等与 LeRobot 社区数据)把全球实验室的演示汇成共享"语料",是 VLA 预训练的燃料,也是个人能训练通用策略的物质基础。

为什么重要

  • kp-002 指出机器人数据比文本少 7 个数量级——数据集共享因此不是锦上添花,而是把多个实验室的数据拼成"能产生涌现的量级"的唯一路径。
  • OXE 联合训练证明:混入其他机器人的数据能让原机器人性能提升约 50%——跨具身数据不是噪音而是增益,这改变了数据收集策略的顶层逻辑。
  • 想微调 VLA(kp-305),必须先读懂数据格式与许可证。

前置知识

kp-403 数据采集、kp-305 VLA。

核心概念

主要数据集地图:

数据集年份规模特点
Open X-Embodiment (OXE)202322 种具身、60+ 子集、100 万+ 轨迹全球 34 实验室联盟;VLA 预训练标准语料
DROID20247.6 万条、86 任务、564 场景(Franka)高质量、多场景、受控采集协议;分布式 13 机构共建
BridgeData V22023数万条(WidowX)低成本采集范式代表,广泛用于 IL 基线
RT-1 数据202213 万条单一大规模同构机队(Everyday Robots)
LeRobot 社区数据集2024-持续增长SO-100/ALOHA 等个人与高校数据,HF Hub 托管
RoboCasa / MimicGen 派生202410 万+(仿真)程序化扩增的仿真演示(kp-403)

数据格式事实标准:RLDS(TensorFlow 生态,RT 系用)与 LeRobot dataset v2/v3(PyTorch 生态,HF Hub 原生)双雄;核心字段:多相机视频流、关节状态、动作、语言指令、时间戳、成功标签。

跨具身对齐:不同机器人动作空间不同(关节角 vs 末端位姿 vs 夹爪开合),OXE 的做法是归一到统一的动作维度约定 + 具身嵌入(embodiment token),让一个模型吃下所有数据。

原理与机制

为什么联合训练有增益:多具身数据共享"物理规律与任务结构"(怎么抓、怎么放),具身差异被模型容量吸收;效果上等价于数据扩增 + 更强的任务先验。RT-X 论文报告:OXE 联合训练使 RT-1-X 在多数基准上比单数据集训练提升 50%。

质量分层:OXE 内部各子集质量参差(采集协议、成功判定、时序对齐差异大);DROID 以严格协议换质量。实践原则:预训练用广而杂,微调用窄而精。

许可证与伦理:各子集许可不一(CC-BY、研究专用等);商用 VLA 需逐一核对。含人场景数据还涉及隐私(kp-603)。

公式与图示

         各实验室独立数据(孤岛)                OXE 联合语料
   Lab A: ALOHA 叠衣  1k 条                ┌────────────────────┐
   Lab B: Franka 插孔 2k 条      ──汇集──► │ 22 具身 × 60 数据集 │
   Lab C: 四足导航   5k 条                │ 1M+ 轨迹,统一格式   │
   ...                                    └─────────┬──────────┘
                                                      ▼
                                    VLA 预训练(RT-X / π0 / OpenVLA)
                                                      ▼
                                    各家微调 → 具身专属策略

数据规模对比(对数轴心智图):

LLM tokens      ████████████████████ 10^13
OXE 轨迹        ██ 10^6   (约 7 个数量级的鸿沟,[kp-002])

直观类比

  • OXE 之于机器人 ≈ Common Crawl 之于 LLM:把散落的网页汇成语料,模型才第一次"读得完人类知识";OXE 把散落的演示汇成语料,策略才第一次"见得完常见任务"。
  • 方言与普通话:每台机器人像一种方言(不同动作空间),OXE 提供的是"普通话语料",各机器人微调就像学口音——先会说话(通用策略),再学方言(具身适配)。

实例与案例

  • OpenVLA 的训练配方:970k OXE 轨迹 → 7B 模型,一张 A100 可微调,成为学术界默认 VLA 基线——数据集可及性直接塑造了研究生态。
  • DROID 微调实验:在 DROID 上预训的策略对"新厨房新物品"的微调适应速度显著快于小数据集预训版本——广度先验的价值。
  • LeRobot 社区:HF Hub 上的社区数据集(如叠衣、插孔、抓取)带可视化工具,一条命令加载,个人复现与课程教学的事实基础设施。

常见误区

  • 误区一:数据集大=好。OXE 混入了大量低质量/短轨迹子集;直接全量训练不如按质量过滤后混合。
  • 误区二:下载即用。跨具身的动作归一化、相机外参缺失、成功标签口径不一都是你要处理的工程债;先可视化抽检再训练。
  • 误区三:只有 VLA 才用得上大数据集。小型策略同样受益:BridgeData 上预训 + 本机微调仍是低成本的通用性提升路径。

自测题

  1. OXE 联合训练的增益机制是什么?"跨具身数据是噪声"为什么被证伪?
  2. 设计你所在实验室的数据集发布:必含哪些字段才能让他人开箱即用?
  3. 对比 RLDS 与 LeRobot 格式,各在什么生态下更顺?

与其他知识点的关系

延伸阅读

  • Open X-Embodiment: Robotic Learning Datasets and RT-X Models, ICRA 2024。
  • DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset, 2024。
  • LeRobot 数据集文档(格式规范 + 可视化工具)。

本节引用来源

  • Open X-Embodiment Collaboration, 2023
  • DROID Team, 2024