视觉-语言-动作模型(VLA)

前沿 学习范式 kp-305 VLART-2pi0OpenVLA基础模型

一句话定义

VLA(Vision-Language-Action)模型把视觉-语言基础模型与动作生成端到端连接:一个模型"看图、听话、出手",用互联网级预训练的语义知识换取机器人操作的泛化能力。

为什么重要

  • 它是当前具身智能的技术主航道:Google(RT 系)、Physical Intelligence(π0)、NVIDIA(GR00T)、Figure(Helix)、DeepMind(Gemini Robotics)全部押注。
  • 它第一次让机器人出现"语义泛化"——执行训练时没见过的指令组合与对象("把恐龙玩具放到火星海报上"),这是小模型专用策略做不到的。
  • 开源版本(OpenVLA、π0 开源权重、LeRobot 生态)让 VLA 微调进入个人与高校可及范围。

前置知识

kp-301、kp-303、Transformer 与 VLM 基础。

核心概念

VLA 的谱系(按时间):

模型年份关键贡献规模
RT-12022机器人操作表述为序列建模,13 台机器人 13 万条演示35M
RT-22023VLM(PaLI-X 55B)直接输出动作 token,语义泛化涌现55B
Octo2023开源通用策略,多具身多头目标条件~27M
OpenVLA20247B 开源(Llama2 + DINOv2/SigLIP),970k OXE 轨迹训练,超 RT-2-X 55B7B
π02024PaliGemma VLM + 流匹配动作专家,50 Hz 高频灵巧操作(叠衣、收纳)3.3B
π0-FAST2025FAST 动作 tokenizer,自回归生成动作 token 提速—
GR00T N12025双系统(VLM System 2 + DiT System 1),含大规模仿真数据2B
Helix2025双系统机载部署(200 Hz 上肢控制),人形全上身7B+7B
Gemini Robotics2025Gemini 2.0 底座的 VLA + 具身推理(ER)变体未公开

动作表示三大流派:

  1. 离散 token:动作离散化成词表,当语言一样自回归生成(RT-2、OpenVLA、FAST)。优点:复用 LLM 全套能力;缺点:离散化损精度、自回归慢。
  2. 扩散/流匹配头:VLM 提供条件,动作由扩散/流生成(π0、GR00T System 1)。优点:连续动作、多模态、高频;缺点:与语言端的接口设计复杂。
  3. 回归头:MLP 直接回归(早期、小模型),被前两者取代。

预训练-微调范式:OXE 等大数据预训练(跨具身、跨任务)→ 目标机器人少量演示微调(LoRA/全参)→ 部署。与 LLM 时代完全同构(kp-002 的数据经济学差距因此被"先验复用"部分弥合)。

原理与机制

以 π0 为代表的双模块架构:

观测(多相机)+ 语言指令
        │
 ┌──────▼───────┐        ┌──────────────────┐
 │ VLM 主干      │──────► │ 动作专家(流匹配) │──► 动作块 [a_t..a_t+k]
 │ PaliGemma 3B  │  条件   │ ~300M, 高频       │     (~50Hz 执行)
 └──────────────┘        └──────────────────┘

关键机制:

  • 双系统分层(kp-003):VLM 慢而聪明管语义,动作头快而专管高频输出;Helix/GR00T 显式化为 System 2 + System 1。
  • 为什么预训练权重有效:RT-2 证明 VLM 学到的物体/空间/常识知识可迁移为操作语义;涌现能力(识别海报上的符号、理解"垃圾"等抽象概念)直接来自语言预训练。
  • 数据配方:OXE(kp-404)提供广度,自采高质量数据提供深度;π0 强调自建数据引擎的规模(万小时级)。

公式与图示

流匹配动作生成(π0 思想):学习速度场 $v_\theta(\mathbf{a}_t, t \mid \mathbf{o}, \ell)$,从噪声 $\mathbf{a}_1\sim\mathcal{N}$ 沿 ODE 积分到动作:

$$\frac{d\mathbf{a}_t}{dt} = v_\theta(\mathbf{a}_t, t \mid \mathbf{o}, \ell)$$

相比 DDPM 扩散,少步采样即可高精度——这是 50 Hz 控制频率的关键。

直观类比

  • VLA = 会看会听的"司机大脑":以前给机器人配的是"只会背路线的司机"(专用策略);VLA 是考过驾照、读过地图、听得懂人话的老司机——去没去过的街区也能开。
  • 微调 ≈ 岗前培训:预训练给了通用驾驶能力,到你家公司还得学这台叉车的脾气(目标任务演示微调)。

实例与案例

  • RT-2 语义泛化:能执行"把可乐递给星战人偶"(训练中无人偶类目),理解"把 extinction 场景里的玩具移到恐龙旁"这类组合指令。
  • π0 叠衣服/装盒:柔软物体操作 + 长时程任务,演示了高频流匹配动作头的灵巧上限;开源后社区在 SO-100 级硬件上复现小任务微调。
  • Helix 物流分拣(2025):双系统模型整机载(无云依赖),上肢 200 Hz 控制处理千奇百怪的包裹——VLA 真机产品化的代表。
  • OpenVLA 社区:LoRA 微调一张消费级 GPU 可完成,成为学术标准 baseline。

常见误区

  • 误区一:VLA=LLM 控制机器人。VLA 的动作端是专门设计的生成模块;把 LLM 文本输出翻译成指令再走传统控制栈的是 kp-307(规划路线),两者架构不同。
  • 误区二:VLA 一步到位替代整个技术栈。伺服层、安全层、感知标定(kp-101)都还在;VLA 主要重构的是"策略层与认知层"。
  • 误区三:开源 VLA 开箱即用。跨具身差距(kp-602)仍在:不同本体几乎必须微调;且预训练数据的场景分布决定它擅长什么。

自测题

  1. 对比动作 token 与流匹配两种动作表示的优劣,各举一个代表模型。
  2. RT-2 的"涌现语义泛化"来自哪里?为什么小模型专用策略做不到?
  3. 你要为一个新机械臂部署 VLA:预训练、微调、部署各环节最可能在哪里失败?

与其他知识点的关系

延伸阅读

  • Brohan et al., RT-2: Vision-Language-Action Models, 2023;Open X-Embodiment, ICRA 2024。
  • Physical Intelligence, π0: A Vision-Language-Action Flow Model, 2024;Kim et al., OpenVLA, CoRL 2024。
  • Figure, Helix, 2025;NVIDIA, GR00T N1, 2025(架构白皮书)。

本节引用来源

  • Brohan et al., RT-2, 2023
  • Physical Intelligence, π0, 2024
  • Kim et al., OpenVLA, 2024