数据飞轮与闭环数据策略
一句话定义
数据飞轮是把"部署 → 采集(尤其是失败) → 自动标注/扩增 → 再训练 → 更强部署"组织成自增强循环的系统性方法——它是机器人数据从"人力采集"走向"规模化自治"的路线图,也是头部具身公司真正的护城河。
为什么重要
- 静态数据集(kp-404)只能换来一次性能力;部署中产生的数据才是无限、多样、免费的——这是与 LLM 数据经济学对齐的关键一步。
- VLA 时代的数据需求(万小时级)远超人工采集能力(kp-403),没有飞轮就没有规模化。
- 面试/商业尽调中的高价值问题:"你们的飞轮转起来了吗?"——能回答这个问题的团队与不能的,估值逻辑完全不同。
前置知识
核心概念
飞轮的五个构件:
- 部署与记录:策略在真实环境运行,全量或采样记录 (观测, 动作, 结果)。
- 失败挖掘:找出策略失败的时刻——它们是信息量最高的样本。方法:成功判定器(力信号、视觉验证器、VLM 判定)、异常检测、人类标注队列。
- 自动标注与重标记:hindsight relabeling(HER, 2017):没抓到目标 A 却抓到了 B?把这条轨迹重标注为"抓 B"的成功演示——失败的物理动作是真实的,只需换个目标标签。仿真中还能做 goal-conditioned 大规模重标记。
- 数据扩增:MimicGen 式重定向(kp-403)、仿真合成(real2sim + 渲染随机化,kp-402)、世界模型生成(kp-306)。
- 再训练与灰度部署:新数据混训 → 离线评测 + 真机金丝雀发布 → 全量更新。类似 MLOps,但"回归测试"是真机任务。
干预式数据(human-in-the-loop):DAgger 思想(kp-301)的产品化——部署时人随时接管,"接管前后的轨迹"自动成为高价值纠错数据。Tesla FSD 的"影子模式+接管数据"就是此范式的最大规模实践,机器人正在复刻。
原理与机制
为什么失败数据最珍贵:模仿学习的演示(kp-301)几乎全是成功轨迹,策略从没学过"出了错怎么回来"(分布漂移的根源)。部署中的失败轨迹恰好覆盖"错误状态流形"——配合正确标注(回退动作),正好补上这块数据。
飞轮闭环(以抓取系统为例):
策略 v_n 部署
│ 记录全部 episode
▼
VLM/力信号判定成功与否 ──► 失败集
│ │
│ 成功集(自动入库) ▼
│ 分析失败模式(抓空?打滑?定位偏?)
│ │
│ 针对性采集/扩增(演示/MimicGen/仿真)
│ │
└──────► 合并训练 ──► 策略 v_{n+1} ──► 灰度验证 ──► 部署
飞轮的度量:单位时间新增"有效纠错数据"条数、失败修复率(每轮迭代失败案例的消除比例)、人工干预率随时间的下降曲线。干预率下降 = 飞轮真正在转。
隐私与治理:部署环境(家庭、工厂)的记录涉及隐私与商业敏感(kp-603),飞轮必须内置数据最小化、脱敏与访问控制,否则法务一票否决。
公式与图示
HER 重标记:原目标 $g$、实际达成 $g'$,把奖励函数换成 $r(s, a, g')$ 重算回报——
$$\mathcal{D} \leftarrow \mathcal{D} \cup \{(s_t, a_t, g', r(s_t,a_t,g'))_{t}\}$$
直觉:任何一段轨迹,都是"它实际导致的结果"的成功演示。这条简单变换把大量"失败"变成训练信号。
每轮迭代
策略能力 ──► 部署范围 ──► 数据多样性
▲ │
└──── 训练更新 ◄── 失败挖掘 ◄──┘
(能转起来的飞轮:干预率随版本单调下降)
直观类比
- 老司机的成长:新手靠驾校教程(静态数据集);老司机靠每天上路遇到的新状况(部署数据)——被别过车、爆过胎之后才真正会开车。失败经历是学习效率最高的燃料。
- 推荐系统的冷启动→飞轮:初期靠编辑推荐(人工演示),上线后用户行为(部署数据)自增强——机器人数据正在重演这个故事。
实例与案例
- Tesla FSD 范式(参照系):车队影子模式 → 接管事件挖掘 → 自动标注 → 模型迭代;机器人界普遍引用此范式作为终局形态。
- Physical Intelligence / Figure 的数据引擎(公开讨论与招聘信息可佐证):远程操作工位 + 自动重置 + 大规模 VLM 判定,目标将干预率逐版本压降;π0 等模型的持续改进依赖此引擎。
- 学术形态:HER(2017)是飞轮思想的最小可行实现;"robot fleets that self-improve"类论文(干预学习、在线 DAgger)不断为飞轮的每个构件提供算法件。
常见误区
- 误区一:装了记录系统=有飞轮。飞轮的判定标准是"新数据是否系统性降低失败率";只存不用(或用了不评估)的数据湖是伪飞轮。
- 误区二:成功判定不重要。判定器的错误率直接污染数据标签;VLM 判定 + 力信号 + 抽查人工复核的混合方案是当前务实解。
- 误区三:飞轮可以替代评测(kp-405)。飞轮优化的是"已知任务变好";回归测试与泛化评测仍然必需,否则"修好 A 学坏 B"的隐式退化无法发现。
自测题
- 用 HER 的思想,把"机器人想放杯子到桌上但杯子倒了"的轨迹转化为有效训练数据。
- 设计部署系统的干预式采集:什么触发接管记录?如何保证标签质量?
- 给出三个量化指标,证明一个团队的数据飞轮"真的在转"。
与其他知识点的关系
- kp-301 模仿学习:飞轮为 IL 持续供弹,尤其是"纠错数据"。
- kp-306 世界模型:飞轮产生的新数据训练更好的世界模型,想象数据再喂回飞轮。
- kp-604 落地:商业上,飞轮成熟度=规模化能力的核心证据。
延伸阅读
- Andrychowicz et al., Hindsight Experience Replay, NeurIPS 2017。
- Ross et al., DAgger, 2011(干预式数据的理论源头)。
- Physical Intelligence、Figure 等公司技术博客/招聘 JD 中关于 Data Engine 的公开描述(用于对照工业实践)。
本节引用来源
- hindsight relabeling: Andrychowicz et al., HER, 2017
- Physical Intelligence 数据引擎公开讨论, 2024-25