泛化难题:分布外、零样本与知识迁移
一句话定义
泛化是具身智能的圣杯与软肋:策略在训练分布之外(新物体、新场景、新指令、新具身、新任务)还能不能工作——当前答案是"语义泛化已现曙光,物理泛化仍是硬仗",而数据广度、预训练先验与微调协议是三条主战线。
为什么重要
- 每个 demo 视频的本质问题是"换个厨房还行吗";泛化边界决定了技术从"演示"到"产品"的距离(kp-503、kp-604)。
- 论文阅读的核心技能:识别作者 claim 的是哪一轴的泛化——五轴混谈是常见的话术烟雾。
- 它是数据策略(kp-404/406)与方法选型(微调 vs 预训练)的决策依据。
前置知识
kp-305 VLA、kp-404 数据集、kp-301 IL。
核心概念
泛化五轴(评估任何策略先问这五问):
- 物体泛化:没见过的物体(新形状/材质/重量)。
- 场景泛化:新背景、光照、相机位姿、干扰物。
- 指令泛化:新的语言表述与组合("把那个红色的像猫的东西拿过来")。
- 具身泛化:跨机器人本体迁移(关节不同、视野不同)。
- 任务/技能泛化:训练任务组合出新技能("用勺子把豆子从A碗拨到B碗"来自舀+倒的先验)。
词汇表:
- In-distribution vs OOD:训练分布内外。机器人 OOD 定义模糊——"分布"是五轴的联合空间,任一轴偏移都是 OOD。
- 零样本/少样本:不经微调直接执行 / 几条演示微调后执行。
- 语义泛化:来自 VLM 预训练的概念知识(RT-2 认得"星战人偶",kp-305)。
- 物理泛化:对未见物理属性(摩擦、柔性、重量)的处理——远比语义泛化难,因为互联网数据里没有"摸过果冻"的先验。
原理与机制
为什么 VLA 有语义泛化:语言预训练注入了物体类别、空间关系、指令结构的先验;动作数据教会"怎么动",语言教会"什么是猫、什么是左边"。两者正交互补。
为什么物理泛化难:物理属性必须通过交互习得(kp-002),文本与视频只能提供间接证据。数据集里的物体集有限 → 策略学到的是"数据集物体流形"上的抓法,OOD 物体(透明、软、形变)立即暴露。
机器人有 scaling law 吗(领域核心争论):经验证据:OXE 联合训练有增益(kp-404)、DROID 广度预训加速微调、π0 数据规模与能力正相关——存在"数据多了确实更好";但没人给出 NLP 式的幂律曲线,且数据质量与多样性比数量更敏感。审慎结论:广度 scaling 有效但效率与平滑性远逊文本,能力呈"台阶式"涌现而非平滑增长。
微调协议(当前最佳实践):
预训练:OXE/DROID 级广度(跨任务跨场景)→ 通用动作先验
微调:目标任务 50~500 条演示 + 部署场景数据 → 分布对准
可选:LoRA(省显存保先验)vs 全参(上限高易过拟合)
评估:训练任务 + 五轴 OOD 各设一档([kp-405])
公式与图示
泛化五轴雷达图(示意:2024-25 SOTA 的相对位置)
物体
80°
╱ ╲
任务 60° ╱ ╲ 60° 指令
│ VLA │
│ SOTA示意 │
具身 40°╲ ╱ 40° 场景
╲ ╱
30°
强轴:指令、物体(语义先验)|弱轴:具身、物理属性、极端场景
OOD 失败的典型形态:置信度不减的错误动作(策略不知道自己不知道)——与文本模型幻觉同源,但物理后果更贵。
直观类比
- 会开车不等于会开所有车:教练车(训练分布)开得溜,第一次开卡车(具身 OOD)要重新适应——跨具身微调就是"换车适应课"。
- 语义先验像读过的书,物理经验像摸过的东西:VLA "读过万卷书"(互联网),但"没行过万里路"(物理交互)——缺的那半只能用机器人数据补。
实例与案例
- RT-2 语义泛化测试:新物体、新指令组合成功率显著高于 RT-1,但绝对值仍远低于同分布任务——"涌现但脆弱"。
- OpenVLA 微调研究:在 ALOHA 类双臂上微调后表现良好,但零样本跨具身(直接上没见过的本体)明显退化——具身泛化仍需微调桥接。
- π0 的能力边界:叠衣等柔性任务惊艳,但作者明确标注对"极端杂乱场景"的失败率——顶级模型也在五轴的弱轴上诚实翻车。
常见误区
- 误区一:训练任务多=泛化好。任务多样性只是五轴之一;50 个任务同一张桌子的数据集,场景轴仍然窄。
- 误区二:VLM 大=泛化好。VLM 先验主要提升语义轴;物理轴的提升来自动作数据质量与多样性,堆 VLM 参数收益递减。
- 误区三:零样本是产品要求。当前工程现实是"广度预训 + 快速微调"(π0 范式);把零样本当硬指标的团队会被自己拖垮。
自测题
- 用五轴给"π0 叠衣服 demo"打分(高/中/低),并说明哪两轴是其薄弱处。
- 设计一个实验区分"策略不会抓透明物体"是语义问题还是物理问题。
- 你的部署场景与训练数据相差最大的是哪一轴?对应的最低成本补救是什么?
与其他知识点的关系
- kp-305 VLA:泛化主张的技术载体。
- kp-404/406 数据:泛化的燃料侧。
- kp-405 基准:泛化的度量侧。
延伸阅读
- Open X-Embodiment 论文的泛化分析节;π0 论文 limitations 节。
- 泛化综述:Towards Generalist Robot Policies 类综述(2024-25 有多篇,选一篇精读其 OOD 分类法即可)。
- Robot Data Curation 类工作(2024-25):数据多样性度量是泛化研究的新前线。
本节引用来源
- Open X-Embodiment, 2023
- π0, 2024
- Kirk et al., generalist policy 泛化讨论, 2023-24