长程任务与具身导航

前沿 前沿与展望 kp-601 长时程任务分解导航VLN记忆

一句话定义

长程任务(long-horizon)要求机器人完成数十步相互依赖的子任务——收拾全屋、做一顿饭——其核心挑战是误差累积与状态恢复;具身导航则是它的空间子问题:在真实世界中"去该去的地方",正从几何导航走向语言引导与语义记忆。

为什么重要

  • 单技能 95% 成功率的技能,十步链路只剩 60%(kp-405)——长程能力是当前 demo 与"真有用"之间最大的鸿沟。
  • 家政、仓储全流程、餐厅服务这些真正的市场,全是长程任务;解决它等于打开商业天花板。
  • "空间记忆 + 语言导航"是 VLA 与 LLM 规划(kp-307)之外的第三条关键能力轴,也是世界模型(kp-306)最有希望的落地场景之一。

前置知识

kp-307 LLM 规划、kp-103 SLAM。

核心概念

长程任务的三大难点:

  1. 误差累积:子任务失败概率相乘,且错误会改变环境状态(打翻的水影响后续所有步骤)。
  2. 状态监测与恢复:需要判断"卡在哪一步、世界变成了什么样、怎么回来"——恢复策略库与重规划。
  3. 记忆:跨房间跨小时的语义记忆("药箱在二楼厕所第二个抽屉")与情景记忆("刚才把杯子放哪了")。

具身导航谱系:

  • 几何导航:SLAM + 规划(kp-103),"去坐标 (x,y)"。
  • 物体目标导航(ObjectNav):"找到冰箱"——开放词汇检测 + 前沿探索(frontier exploration)。
  • 视觉语言导航(VLN):"穿过客厅,在沙发旁左转,停在电视机前"——指令跟随导航,基准:R2R(2018 起);大模型时代 LM-Nav 等用 LLM 解析指令与地标。
  • 移动操作(Mobile Manipulation):导航+操作耦合(Mobile ALOHA、OK-Robot, 2024:开放词汇感知 + 导航 + 抓取的模块化拼装,无需训练即可在真实家庭干活——工程组合主义的代表)。

原理与机制

分层架构(当前主流):

LLM(任务分解 + 失败诊断,~1Hz)
   │ 子目标序列:"走到厨房台 → 找杯子 → 抓 → 放到水槽"
   ▼
技能执行器(导航技能 / 操作技能 / VLA 子任务)
   │ 每步结束回报状态
   ▼
状态监测器(VLM 判定子任务成败 + 异常检测)
   │ 失败 → 分类 → 恢复策略(重试/绕路/回退/求助)
   └──► 反馈回 LLM 重规划([kp-307] Inner Monologue 式)

恢复行为的工程学:预定义恢复原语(退一步、重新扫描、换抓取位、呼叫人类)比"更聪明的规划器"更实用;恢复决策树是长程系统可靠性的主要来源。

空间记忆:语义地图(kp-103)上挂物体实例与时间戳 → 可查询("杯子最后出现在哪");前沿工作用 3DGS/NeRF 做可渲染记忆,VLM 做语义查询接口。

公式与图示

长程成功率与两个杠杆:

$$P_{task} = \prod_{i=1}^{n} p_i \times P_{recover}$$

两个改进杠杆:提高单步 $p_i$(更好的技能),或提高恢复成功率 $P_{recover}$(失败后仍能完成)。工程上后者性价比远高:把"卡住=失败"变成"卡住=多花 30 秒"。

   无恢复:p^n 直接相乘
   有恢复:每步失败后以 r 概率救回 → P = [p + (1-p)·r]^n
   例:p=0.9, n=10:无恢复 0.35;r=0.6 时 (0.9+0.1·0.6)^10 ≈ 0.94

直观类比

  • 做饭不是炒菜:炒菜是一个技能(单步 95%),做一顿饭是"买菜-洗切-备锅-顺序控制-摆盘"的链路(kp-405 的 $0.9^n$);家庭机器人卡住的不是"炒",是"盐在哪"。
  • GPS 导航的演进:坐标导航 → 地名导航 → "带我去那家上次吃过的店"(语义记忆)——机器人导航正在重演。

实例与案例

  • OK-Robot(2024):零训练拼装(开放词汇检测 + Voxel 地图 + 运动原语)在 5 个真实家庭完成 109 次捡放任务,成功率约 83%——模块化长程系统的可行性与局限的最好样本。
  • Mobile ALOHA 全屋任务:炒菜、进电梯等演示展示了长程形态,但复现研究同时暴露其对环境一致的强依赖。
  • VLN 前沿:VLN-CE(连续环境版)、LLM 分解 + VLA 执行的组合正成为家庭助手的标准架构假设(各家 demo 的隐含架构)。

常见误区

  • 误区一:长程=把更多技能串起来。串接容易,状态监测与恢复才是工作量主体;设计时先画"失败模式清单"再写技能。
  • 误区二:端到端模型自动学会长程。当前 VLA 有效时域仍短(数十秒级);长程靠分层,端到端是研究方向不是现状。
  • 误区三:记忆=存地图。语义记忆的难点在更新(物体被人挪走后记忆过期)与遗忘策略,存储只是最简单的部分。

自测题

  1. 用 $[p+(1-p)r]^n$ 框架分析:提高单步成功率与提高恢复率,何时收益更大?
  2. 设计"收拾餐桌"的恢复策略清单(至少 5 种失败情形对应 5 种恢复动作)。
  3. ObjectNav 与 VLN 的信息输入差异是什么?各需要什么感知模块?

与其他知识点的关系

延伸阅读

  • Anderson et al., Vision-and-Language Navigation: Interpreting Visually-Grounded Navigation Instructions, CVPR 2018。
  • Liu et al., OK-Robot, 2024(项目页含家庭实测视频)。
  • Mobile ALOHA(2024)与复现报告——长程现实的坦率样本。

本节引用来源

  • Anderson et al., Vision-and-Language Navigation, 2018
  • Liu et al., OK-Robot, 2024