视觉-语言-动作模型(VLA)
一句话定义
VLA(Vision-Language-Action)模型把视觉-语言基础模型与动作生成端到端连接:一个模型"看图、听话、出手",用互联网级预训练的语义知识换取机器人操作的泛化能力。
为什么重要
- 它是当前具身智能的技术主航道:Google(RT 系)、Physical Intelligence(π0)、NVIDIA(GR00T)、Figure(Helix)、DeepMind(Gemini Robotics)全部押注。
- 它第一次让机器人出现"语义泛化"——执行训练时没见过的指令组合与对象("把恐龙玩具放到火星海报上"),这是小模型专用策略做不到的。
- 开源版本(OpenVLA、π0 开源权重、LeRobot 生态)让 VLA 微调进入个人与高校可及范围。
前置知识
kp-301、kp-303、Transformer 与 VLM 基础。
核心概念
VLA 的谱系(按时间):
| 模型 | 年份 | 关键贡献 | 规模 |
|---|---|---|---|
| RT-1 | 2022 | 机器人操作表述为序列建模,13 台机器人 13 万条演示 | 35M |
| RT-2 | 2023 | VLM(PaLI-X 55B)直接输出动作 token,语义泛化涌现 | 55B |
| Octo | 2023 | 开源通用策略,多具身多头目标条件 | ~27M |
| OpenVLA | 2024 | 7B 开源(Llama2 + DINOv2/SigLIP),970k OXE 轨迹训练,超 RT-2-X 55B | 7B |
| π0 | 2024 | PaliGemma VLM + 流匹配动作专家,50 Hz 高频灵巧操作(叠衣、收纳) | 3.3B |
| π0-FAST | 2025 | FAST 动作 tokenizer,自回归生成动作 token 提速 | — |
| GR00T N1 | 2025 | 双系统(VLM System 2 + DiT System 1),含大规模仿真数据 | 2B |
| Helix | 2025 | 双系统机载部署(200 Hz 上肢控制),人形全上身 | 7B+7B |
| Gemini Robotics | 2025 | Gemini 2.0 底座的 VLA + 具身推理(ER)变体 | 未公开 |
动作表示三大流派:
- 离散 token:动作离散化成词表,当语言一样自回归生成(RT-2、OpenVLA、FAST)。优点:复用 LLM 全套能力;缺点:离散化损精度、自回归慢。
- 扩散/流匹配头:VLM 提供条件,动作由扩散/流生成(π0、GR00T System 1)。优点:连续动作、多模态、高频;缺点:与语言端的接口设计复杂。
- 回归头:MLP 直接回归(早期、小模型),被前两者取代。
预训练-微调范式:OXE 等大数据预训练(跨具身、跨任务)→ 目标机器人少量演示微调(LoRA/全参)→ 部署。与 LLM 时代完全同构(kp-002 的数据经济学差距因此被"先验复用"部分弥合)。
原理与机制
以 π0 为代表的双模块架构:
观测(多相机)+ 语言指令
│
┌──────▼───────┐ ┌──────────────────┐
│ VLM 主干 │──────► │ 动作专家(流匹配) │──► 动作块 [a_t..a_t+k]
│ PaliGemma 3B │ 条件 │ ~300M, 高频 │ (~50Hz 执行)
└──────────────┘ └──────────────────┘
关键机制:
- 双系统分层(kp-003):VLM 慢而聪明管语义,动作头快而专管高频输出;Helix/GR00T 显式化为 System 2 + System 1。
- 为什么预训练权重有效:RT-2 证明 VLM 学到的物体/空间/常识知识可迁移为操作语义;涌现能力(识别海报上的符号、理解"垃圾"等抽象概念)直接来自语言预训练。
- 数据配方:OXE(kp-404)提供广度,自采高质量数据提供深度;π0 强调自建数据引擎的规模(万小时级)。
公式与图示
流匹配动作生成(π0 思想):学习速度场 $v_\theta(\mathbf{a}_t, t \mid \mathbf{o}, \ell)$,从噪声 $\mathbf{a}_1\sim\mathcal{N}$ 沿 ODE 积分到动作:
$$\frac{d\mathbf{a}_t}{dt} = v_\theta(\mathbf{a}_t, t \mid \mathbf{o}, \ell)$$
相比 DDPM 扩散,少步采样即可高精度——这是 50 Hz 控制频率的关键。
直观类比
- VLA = 会看会听的"司机大脑":以前给机器人配的是"只会背路线的司机"(专用策略);VLA 是考过驾照、读过地图、听得懂人话的老司机——去没去过的街区也能开。
- 微调 ≈ 岗前培训:预训练给了通用驾驶能力,到你家公司还得学这台叉车的脾气(目标任务演示微调)。
实例与案例
- RT-2 语义泛化:能执行"把可乐递给星战人偶"(训练中无人偶类目),理解"把 extinction 场景里的玩具移到恐龙旁"这类组合指令。
- π0 叠衣服/装盒:柔软物体操作 + 长时程任务,演示了高频流匹配动作头的灵巧上限;开源后社区在 SO-100 级硬件上复现小任务微调。
- Helix 物流分拣(2025):双系统模型整机载(无云依赖),上肢 200 Hz 控制处理千奇百怪的包裹——VLA 真机产品化的代表。
- OpenVLA 社区:LoRA 微调一张消费级 GPU 可完成,成为学术标准 baseline。
常见误区
- 误区一:VLA=LLM 控制机器人。VLA 的动作端是专门设计的生成模块;把 LLM 文本输出翻译成指令再走传统控制栈的是 kp-307(规划路线),两者架构不同。
- 误区二:VLA 一步到位替代整个技术栈。伺服层、安全层、感知标定(kp-101)都还在;VLA 主要重构的是"策略层与认知层"。
- 误区三:开源 VLA 开箱即用。跨具身差距(kp-602)仍在:不同本体几乎必须微调;且预训练数据的场景分布决定它擅长什么。
自测题
- 对比动作 token 与流匹配两种动作表示的优劣,各举一个代表模型。
- RT-2 的"涌现语义泛化"来自哪里?为什么小模型专用策略做不到?
- 你要为一个新机械臂部署 VLA:预训练、微调、部署各环节最可能在哪里失败?
与其他知识点的关系
- kp-004 发展史:本节是"VLA 时代"的深潜。
- kp-404 数据集与 kp-406 数据飞轮:VLA 的燃料系统。
- kp-602 泛化:VLA 的能力边界分析。
延伸阅读
- Brohan et al., RT-2: Vision-Language-Action Models, 2023;Open X-Embodiment, ICRA 2024。
- Physical Intelligence, π0: A Vision-Language-Action Flow Model, 2024;Kim et al., OpenVLA, CoRL 2024。
- Figure, Helix, 2025;NVIDIA, GR00T N1, 2025(架构白皮书)。
本节引用来源
- Brohan et al., RT-2, 2023
- Physical Intelligence, π0, 2024
- Kim et al., OpenVLA, 2024