评估基准与评测方法论
一句话定义
评估基准(RLBench、Meta-World、CALVIN、LIBERO、ManiSkill、RoboCasa 及各类真机协议)为策略提供可比较的考卷;但"仿真成功率 ≠ 真机成功率",读懂评测协议与它的坑,和会训练策略同样重要。
为什么重要
- 没有共同基准就没有进步的刻度尺:Diffusion Policy、ACT、VLA 的相对优劣全部由这些分数说话(kp-303/304)。
- 机器人评测的泛化轴(新物体/新位姿/新光照/新指令)正在取代"固定任务成功率"成为核心指标——这直接反映了领域对 kp-602 泛化问题的重视。
- 复现论文时,失败原因经常不在算法,而在评测协议的隐藏细节(初始状态分布、成功判定、训练配置)。
前置知识
核心概念
主要基准地图:
| 基准 | 年份 | 定位 | 常用于 |
|---|---|---|---|
| RLBench | 2020 | 100+ 仿真操作任务、RLDS 化 | 抓取/精细操作对比 |
| Meta-World | 2020 | 50 个元学习操作任务 | 多任务/元学习 |
| CALVIN | 2021 | 长时程语言条件任务链(A→B→C 连打) | 语言条件 IL、长时程 |
| LIBERO | 2023 | 130 任务 5 套件(知识/目标/物体/空间/100)+ 终身学习协议 | IL/VLA 标准考场、持续学习 |
| ManiSkill 2/3 | 2021-24 | GPU 并行操作 + 大资产 | RL/IL 操作、可扩展评测 |
| RoboCasa | 2024 | 大规模厨房场景 + 自动生成任务 | 系统级泛化评测 |
| HumanoidBench / Isaac 系 | 2024 | 人形全身控制任务 | locomotion/WBC |
| 真机协议 | — | ALOHA 移物板、标准抓取板、跨实验室真机评测(如 Autonomous eval of RT-X) | 最终裁决 |
评测维度:
- 成功率:任务判定的口径(位姿阈值?接触保持时间?)决定分数的可信度。
- 泛化轴:LIBERO 的分套件设计即为系统拆解"哪种泛化差":训练见过 vs 没见过的物体/空间/目标组合。
- 效率指标:完成任务时间、数据效率(多少演示达到 x%)、计算成本。
- 长时程:CALVIN 式任务链——单步 90% 成功率的技能链 5 步只剩 59%($0.9^5$),暴露累积脆弱性。
原理与机制
为什么仿真分数高开低走于真机:仿真初始分布固定、成功判定确定、无传感噪声;真机每个环节都松。因此社区做法是"仿真基准筛方法 + 真机协议验存活",两层都过才算数。
评测协议的隐藏变量(复现时必查):
- 初始状态采样范围(LIBERO 各论文的相机位姿与物体扰动范围不同);
- 成功判定的松紧(接触容差、角度阈值);
- 训练时是否见过评测场景(数据泄漏是常见事故);
- 评测 rollout 数(30 次与 300 次的置信区间差异巨大)。
VLA 评测的新趋势:语义泛化评测(训练未见指令组合)、真机跨实验室统一评测(OXE 论文的做法:模型在非合作实验室的机器上盲测)、人类偏好打分(演示质量)。
公式与图示
长时程累积成功率:$P_{chain} = \prod_i p_i$,若 $p_i = 0.95$、链长 10,则 $P = 0.60$。
单技能成功率 → 链长下的整体成功率
0.99 → 10步: 0.90
0.95 → 10步: 0.60
0.90 → 10步: 0.35 ← 长时程对单步质量的极端敏感性
0.85 → 10步: 0.20
置信区间:成功率 $p$、rollout 次数 $n$ 的标准误 $\sqrt{p(1-p)/n}$;$n=30, p=0.8$ 时 ±7 个百分点——比较 78% vs 84% 的论文结论基本是噪音。
直观类比
- 驾考与真实上路:仿真基准=科目二(固定场地固定动作);真机评测=上路(一切皆变量)。科目二满分不等于会开车——但科目二都不过,更别提上路。
- $0.9^{10}$ 的数学:十道工序每道 90% 合格率的生产线,出厂合格率只有 35%——这就是为什么评测要单技能和全链路分开看。
实例与案例
- LIBERO 现象:2023-2025 几乎所有 IL/VLA 论文都刷 LIBERO(OpenVLA、π0 微调、各类动作头对比),同时社区开始抱怨"LIBERO 过拟合"——榜单分数与真机表现的相关性正在被质疑,催生 RoboCasa 等更大规模基准。
- Push-T:单任务基准,因"任务简单到可穷举失败模式、复杂到能区分策略"成为 Diffusion Policy 论文后社区爱用的试金石。
- 真机盲评:RT-X 论文让模型在未参与训练的实验室机器上评测,是方法学上的重要进步——相当于"异校高考"。
常见误区
- 误区一:只看排行榜数字。先读协议(初始分布、成功判定、rollout 数)再读分数;不写 rollout 数的成功率默认存疑。
- 误区二:仿真成功率=部署价值。部署价值 = 真机成功率 × 任务经济价值 × 干预成本;仿真分数只是第一步筛选。
- 误区三:单一任务定生死。泛化轴(物体/位姿/指令/场景)必须分开报;只报固定分布成功率的论文泛化能力存疑。
自测题
- 计算链长 8、单步成功率 0.92 的任务链整体成功率;要提高整体成功率,优先改进什么?
- 列出复现 LIBERO 论文时必须核对的四个协议细节。
- 设计一个"新物体泛化"真机评测协议(物体集、场景数、rollout 数、判定标准)。
与其他知识点的关系
- kp-303/304:基准上的主角策略。
- kp-602 泛化:泛化评测的理论框架。
- kp-406 数据飞轮:评测失败案例是飞轮的输入。
延伸阅读
- LIBERO / CALVIN / RLBench 原论文与排行榜页。
- 实操推荐:精读 OpenVLA、π0 论文的实验节,学习顶会工作如何组织评测协议(初始分布、泛化轴、rollout 数的报告方式)。
本节引用来源
- Liu et al., LIBERO, 2023
- Mees et al., CALVIN, 2021
- James et al., RLBench, 2020