开源数据集生态
一句话定义
开源机器人数据集(Open X-Embodiment、DROID、BridgeData 等与 LeRobot 社区数据)把全球实验室的演示汇成共享"语料",是 VLA 预训练的燃料,也是个人能训练通用策略的物质基础。
为什么重要
- kp-002 指出机器人数据比文本少 7 个数量级——数据集共享因此不是锦上添花,而是把多个实验室的数据拼成"能产生涌现的量级"的唯一路径。
- OXE 联合训练证明:混入其他机器人的数据能让原机器人性能提升约 50%——跨具身数据不是噪音而是增益,这改变了数据收集策略的顶层逻辑。
- 想微调 VLA(kp-305),必须先读懂数据格式与许可证。
前置知识
核心概念
主要数据集地图:
| 数据集 | 年份 | 规模 | 特点 |
|---|---|---|---|
| Open X-Embodiment (OXE) | 2023 | 22 种具身、60+ 子集、100 万+ 轨迹 | 全球 34 实验室联盟;VLA 预训练标准语料 |
| DROID | 2024 | 7.6 万条、86 任务、564 场景(Franka) | 高质量、多场景、受控采集协议;分布式 13 机构共建 |
| BridgeData V2 | 2023 | 数万条(WidowX) | 低成本采集范式代表,广泛用于 IL 基线 |
| RT-1 数据 | 2022 | 13 万条 | 单一大规模同构机队(Everyday Robots) |
| LeRobot 社区数据集 | 2024- | 持续增长 | SO-100/ALOHA 等个人与高校数据,HF Hub 托管 |
| RoboCasa / MimicGen 派生 | 2024 | 10 万+(仿真) | 程序化扩增的仿真演示(kp-403) |
数据格式事实标准:RLDS(TensorFlow 生态,RT 系用)与 LeRobot dataset v2/v3(PyTorch 生态,HF Hub 原生)双雄;核心字段:多相机视频流、关节状态、动作、语言指令、时间戳、成功标签。
跨具身对齐:不同机器人动作空间不同(关节角 vs 末端位姿 vs 夹爪开合),OXE 的做法是归一到统一的动作维度约定 + 具身嵌入(embodiment token),让一个模型吃下所有数据。
原理与机制
为什么联合训练有增益:多具身数据共享"物理规律与任务结构"(怎么抓、怎么放),具身差异被模型容量吸收;效果上等价于数据扩增 + 更强的任务先验。RT-X 论文报告:OXE 联合训练使 RT-1-X 在多数基准上比单数据集训练提升 50%。
质量分层:OXE 内部各子集质量参差(采集协议、成功判定、时序对齐差异大);DROID 以严格协议换质量。实践原则:预训练用广而杂,微调用窄而精。
许可证与伦理:各子集许可不一(CC-BY、研究专用等);商用 VLA 需逐一核对。含人场景数据还涉及隐私(kp-603)。
公式与图示
各实验室独立数据(孤岛) OXE 联合语料
Lab A: ALOHA 叠衣 1k 条 ┌────────────────────┐
Lab B: Franka 插孔 2k 条 ──汇集──► │ 22 具身 × 60 数据集 │
Lab C: 四足导航 5k 条 │ 1M+ 轨迹,统一格式 │
... └─────────┬──────────┘
▼
VLA 预训练(RT-X / π0 / OpenVLA)
▼
各家微调 → 具身专属策略
数据规模对比(对数轴心智图):
LLM tokens ████████████████████ 10^13
OXE 轨迹 ██ 10^6 (约 7 个数量级的鸿沟,[kp-002])
直观类比
- OXE 之于机器人 ≈ Common Crawl 之于 LLM:把散落的网页汇成语料,模型才第一次"读得完人类知识";OXE 把散落的演示汇成语料,策略才第一次"见得完常见任务"。
- 方言与普通话:每台机器人像一种方言(不同动作空间),OXE 提供的是"普通话语料",各机器人微调就像学口音——先会说话(通用策略),再学方言(具身适配)。
实例与案例
- OpenVLA 的训练配方:970k OXE 轨迹 → 7B 模型,一张 A100 可微调,成为学术界默认 VLA 基线——数据集可及性直接塑造了研究生态。
- DROID 微调实验:在 DROID 上预训的策略对"新厨房新物品"的微调适应速度显著快于小数据集预训版本——广度先验的价值。
- LeRobot 社区:HF Hub 上的社区数据集(如叠衣、插孔、抓取)带可视化工具,一条命令加载,个人复现与课程教学的事实基础设施。
常见误区
- 误区一:数据集大=好。OXE 混入了大量低质量/短轨迹子集;直接全量训练不如按质量过滤后混合。
- 误区二:下载即用。跨具身的动作归一化、相机外参缺失、成功标签口径不一都是你要处理的工程债;先可视化抽检再训练。
- 误区三:只有 VLA 才用得上大数据集。小型策略同样受益:BridgeData 上预训 + 本机微调仍是低成本的通用性提升路径。
自测题
- OXE 联合训练的增益机制是什么?"跨具身数据是噪声"为什么被证伪?
- 设计你所在实验室的数据集发布:必含哪些字段才能让他人开箱即用?
- 对比 RLDS 与 LeRobot 格式,各在什么生态下更顺?
与其他知识点的关系
- kp-305 VLA:数据集的直接消费者。
- kp-406 数据飞轮:开源数据集是飞轮的初始推动力。
- kp-602 泛化:数据广度与泛化边界的实证来源。
延伸阅读
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models, ICRA 2024。
- DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset, 2024。
- LeRobot 数据集文档(格式规范 + 可视化工具)。
本节引用来源
- Open X-Embodiment Collaboration, 2023
- DROID Team, 2024