长程任务与具身导航
一句话定义
长程任务(long-horizon)要求机器人完成数十步相互依赖的子任务——收拾全屋、做一顿饭——其核心挑战是误差累积与状态恢复;具身导航则是它的空间子问题:在真实世界中"去该去的地方",正从几何导航走向语言引导与语义记忆。
为什么重要
- 单技能 95% 成功率的技能,十步链路只剩 60%(kp-405)——长程能力是当前 demo 与"真有用"之间最大的鸿沟。
- 家政、仓储全流程、餐厅服务这些真正的市场,全是长程任务;解决它等于打开商业天花板。
- "空间记忆 + 语言导航"是 VLA 与 LLM 规划(kp-307)之外的第三条关键能力轴,也是世界模型(kp-306)最有希望的落地场景之一。
前置知识
核心概念
长程任务的三大难点:
- 误差累积:子任务失败概率相乘,且错误会改变环境状态(打翻的水影响后续所有步骤)。
- 状态监测与恢复:需要判断"卡在哪一步、世界变成了什么样、怎么回来"——恢复策略库与重规划。
- 记忆:跨房间跨小时的语义记忆("药箱在二楼厕所第二个抽屉")与情景记忆("刚才把杯子放哪了")。
具身导航谱系:
- 几何导航:SLAM + 规划(kp-103),"去坐标 (x,y)"。
- 物体目标导航(ObjectNav):"找到冰箱"——开放词汇检测 + 前沿探索(frontier exploration)。
- 视觉语言导航(VLN):"穿过客厅,在沙发旁左转,停在电视机前"——指令跟随导航,基准:R2R(2018 起);大模型时代 LM-Nav 等用 LLM 解析指令与地标。
- 移动操作(Mobile Manipulation):导航+操作耦合(Mobile ALOHA、OK-Robot, 2024:开放词汇感知 + 导航 + 抓取的模块化拼装,无需训练即可在真实家庭干活——工程组合主义的代表)。
原理与机制
分层架构(当前主流):
LLM(任务分解 + 失败诊断,~1Hz)
│ 子目标序列:"走到厨房台 → 找杯子 → 抓 → 放到水槽"
▼
技能执行器(导航技能 / 操作技能 / VLA 子任务)
│ 每步结束回报状态
▼
状态监测器(VLM 判定子任务成败 + 异常检测)
│ 失败 → 分类 → 恢复策略(重试/绕路/回退/求助)
└──► 反馈回 LLM 重规划([kp-307] Inner Monologue 式)
恢复行为的工程学:预定义恢复原语(退一步、重新扫描、换抓取位、呼叫人类)比"更聪明的规划器"更实用;恢复决策树是长程系统可靠性的主要来源。
空间记忆:语义地图(kp-103)上挂物体实例与时间戳 → 可查询("杯子最后出现在哪");前沿工作用 3DGS/NeRF 做可渲染记忆,VLM 做语义查询接口。
公式与图示
长程成功率与两个杠杆:
$$P_{task} = \prod_{i=1}^{n} p_i \times P_{recover}$$
两个改进杠杆:提高单步 $p_i$(更好的技能),或提高恢复成功率 $P_{recover}$(失败后仍能完成)。工程上后者性价比远高:把"卡住=失败"变成"卡住=多花 30 秒"。
无恢复:p^n 直接相乘
有恢复:每步失败后以 r 概率救回 → P = [p + (1-p)·r]^n
例:p=0.9, n=10:无恢复 0.35;r=0.6 时 (0.9+0.1·0.6)^10 ≈ 0.94
直观类比
- 做饭不是炒菜:炒菜是一个技能(单步 95%),做一顿饭是"买菜-洗切-备锅-顺序控制-摆盘"的链路(kp-405 的 $0.9^n$);家庭机器人卡住的不是"炒",是"盐在哪"。
- GPS 导航的演进:坐标导航 → 地名导航 → "带我去那家上次吃过的店"(语义记忆)——机器人导航正在重演。
实例与案例
- OK-Robot(2024):零训练拼装(开放词汇检测 + Voxel 地图 + 运动原语)在 5 个真实家庭完成 109 次捡放任务,成功率约 83%——模块化长程系统的可行性与局限的最好样本。
- Mobile ALOHA 全屋任务:炒菜、进电梯等演示展示了长程形态,但复现研究同时暴露其对环境一致的强依赖。
- VLN 前沿:VLN-CE(连续环境版)、LLM 分解 + VLA 执行的组合正成为家庭助手的标准架构假设(各家 demo 的隐含架构)。
常见误区
- 误区一:长程=把更多技能串起来。串接容易,状态监测与恢复才是工作量主体;设计时先画"失败模式清单"再写技能。
- 误区二:端到端模型自动学会长程。当前 VLA 有效时域仍短(数十秒级);长程靠分层,端到端是研究方向不是现状。
- 误区三:记忆=存地图。语义记忆的难点在更新(物体被人挪走后记忆过期)与遗忘策略,存储只是最简单的部分。
自测题
- 用 $[p+(1-p)r]^n$ 框架分析:提高单步成功率与提高恢复率,何时收益更大?
- 设计"收拾餐桌"的恢复策略清单(至少 5 种失败情形对应 5 种恢复动作)。
- ObjectNav 与 VLN 的信息输入差异是什么?各需要什么感知模块?
与其他知识点的关系
- kp-307 LLM 规划:任务分解引擎。
- kp-306 世界模型:模拟"这步失败了会怎样",用于恢复策略训练。
- kp-405 基准:长程评测(CALVIN、真机家庭协议)。
延伸阅读
- Anderson et al., Vision-and-Language Navigation: Interpreting Visually-Grounded Navigation Instructions, CVPR 2018。
- Liu et al., OK-Robot, 2024(项目页含家庭实测视频)。
- Mobile ALOHA(2024)与复现报告——长程现实的坦率样本。
本节引用来源
- Anderson et al., Vision-and-Language Navigation, 2018
- Liu et al., OK-Robot, 2024