评估基准与评测方法论

核心 数据、仿真与评估 kp-405 基准LIBEROCALVIN成功率评测

一句话定义

评估基准(RLBench、Meta-World、CALVIN、LIBERO、ManiSkill、RoboCasa 及各类真机协议)为策略提供可比较的考卷;但"仿真成功率 ≠ 真机成功率",读懂评测协议与它的坑,和会训练策略同样重要。

为什么重要

  • 没有共同基准就没有进步的刻度尺:Diffusion Policy、ACT、VLA 的相对优劣全部由这些分数说话(kp-303/304)。
  • 机器人评测的泛化轴(新物体/新位姿/新光照/新指令)正在取代"固定任务成功率"成为核心指标——这直接反映了领域对 kp-602 泛化问题的重视。
  • 复现论文时,失败原因经常不在算法,而在评测协议的隐藏细节(初始状态分布、成功判定、训练配置)。

前置知识

kp-401 仿真、kp-301 IL。

核心概念

主要基准地图:

基准年份定位常用于
RLBench2020100+ 仿真操作任务、RLDS 化抓取/精细操作对比
Meta-World202050 个元学习操作任务多任务/元学习
CALVIN2021长时程语言条件任务链(A→B→C 连打)语言条件 IL、长时程
LIBERO2023130 任务 5 套件(知识/目标/物体/空间/100)+ 终身学习协议IL/VLA 标准考场、持续学习
ManiSkill 2/32021-24GPU 并行操作 + 大资产RL/IL 操作、可扩展评测
RoboCasa2024大规模厨房场景 + 自动生成任务系统级泛化评测
HumanoidBench / Isaac 系2024人形全身控制任务locomotion/WBC
真机协议—ALOHA 移物板、标准抓取板、跨实验室真机评测(如 Autonomous eval of RT-X)最终裁决

评测维度:

  • 成功率:任务判定的口径(位姿阈值?接触保持时间?)决定分数的可信度。
  • 泛化轴:LIBERO 的分套件设计即为系统拆解"哪种泛化差":训练见过 vs 没见过的物体/空间/目标组合。
  • 效率指标:完成任务时间、数据效率(多少演示达到 x%)、计算成本。
  • 长时程:CALVIN 式任务链——单步 90% 成功率的技能链 5 步只剩 59%($0.9^5$),暴露累积脆弱性。

原理与机制

为什么仿真分数高开低走于真机:仿真初始分布固定、成功判定确定、无传感噪声;真机每个环节都松。因此社区做法是"仿真基准筛方法 + 真机协议验存活",两层都过才算数。

评测协议的隐藏变量(复现时必查):

  1. 初始状态采样范围(LIBERO 各论文的相机位姿与物体扰动范围不同);
  2. 成功判定的松紧(接触容差、角度阈值);
  3. 训练时是否见过评测场景(数据泄漏是常见事故);
  4. 评测 rollout 数(30 次与 300 次的置信区间差异巨大)。

VLA 评测的新趋势:语义泛化评测(训练未见指令组合)、真机跨实验室统一评测(OXE 论文的做法:模型在非合作实验室的机器上盲测)、人类偏好打分(演示质量)。

公式与图示

长时程累积成功率:$P_{chain} = \prod_i p_i$,若 $p_i = 0.95$、链长 10,则 $P = 0.60$。

单技能成功率 → 链长下的整体成功率
0.99 → 10步: 0.90
0.95 → 10步: 0.60
0.90 → 10步: 0.35     ← 长时程对单步质量的极端敏感性
0.85 → 10步: 0.20

置信区间:成功率 $p$、rollout 次数 $n$ 的标准误 $\sqrt{p(1-p)/n}$;$n=30, p=0.8$ 时 ±7 个百分点——比较 78% vs 84% 的论文结论基本是噪音。

直观类比

  • 驾考与真实上路:仿真基准=科目二(固定场地固定动作);真机评测=上路(一切皆变量)。科目二满分不等于会开车——但科目二都不过,更别提上路。
  • $0.9^{10}$ 的数学:十道工序每道 90% 合格率的生产线,出厂合格率只有 35%——这就是为什么评测要单技能和全链路分开看。

实例与案例

  • LIBERO 现象:2023-2025 几乎所有 IL/VLA 论文都刷 LIBERO(OpenVLA、π0 微调、各类动作头对比),同时社区开始抱怨"LIBERO 过拟合"——榜单分数与真机表现的相关性正在被质疑,催生 RoboCasa 等更大规模基准。
  • Push-T:单任务基准,因"任务简单到可穷举失败模式、复杂到能区分策略"成为 Diffusion Policy 论文后社区爱用的试金石。
  • 真机盲评:RT-X 论文让模型在未参与训练的实验室机器上评测,是方法学上的重要进步——相当于"异校高考"。

常见误区

  • 误区一:只看排行榜数字。先读协议(初始分布、成功判定、rollout 数)再读分数;不写 rollout 数的成功率默认存疑。
  • 误区二:仿真成功率=部署价值。部署价值 = 真机成功率 × 任务经济价值 × 干预成本;仿真分数只是第一步筛选。
  • 误区三:单一任务定生死。泛化轴(物体/位姿/指令/场景)必须分开报;只报固定分布成功率的论文泛化能力存疑。

自测题

  1. 计算链长 8、单步成功率 0.92 的任务链整体成功率;要提高整体成功率,优先改进什么?
  2. 列出复现 LIBERO 论文时必须核对的四个协议细节。
  3. 设计一个"新物体泛化"真机评测协议(物体集、场景数、rollout 数、判定标准)。

与其他知识点的关系

延伸阅读

  • LIBERO / CALVIN / RLBench 原论文与排行榜页。
  • 实操推荐:精读 OpenVLA、π0 论文的实验节,学习顶会工作如何组织评测协议(初始分布、泛化轴、rollout 数的报告方式)。

本节引用来源

  • Liu et al., LIBERO, 2023
  • Mees et al., CALVIN, 2021
  • James et al., RLBench, 2020