发展史:从控制论到 VLA 时代
一句话定义
具身智能七十余年的主线,是"智能从哪来"三种流派的此消彼长:控制论(反馈即智能)→ 符号主义(推理即智能)→ 行为主义(交互即智能)→ 学习主义(数据即智能),而 2022 年后的大模型时代正在把它们拧成一股绳。
为什么重要
- 每一次范式摇摆都对应一次"押注错误就落后十年"的行业分水岭;读史可以帮你识别当下叙事中的旧争论重演。
- 今天的技术栈(VLA、RL、WBC)没有一个是凭空出现的,都能在历史中找到原型与失败教训。
前置知识
核心概念:五个时代
1. 控制论时代(1940s–1960s) W. Grey Walter 的电子龟 Elmer/Elsie(1948-49)用两个神经元电路实现了趋光与避障的"看似有目的"的行为——最早的"简单机制产生复杂行为"证明。维纳的控制论(Cybernetics, 1948)确立反馈思想。1961 年 Unimate 机械臂进入通用汽车产线,工业机器人产业诞生。
2. 符号主义/认知主义时代(1960s–1980s) SRI 的 Shakey(1966–72)首次集成感知-规划-行动:视觉识别房间、STRIPS 做符号规划。AI 主流相信"推理优先、感知凑合"。但机器人被证明在真实环境中举步维艰,"莫拉维克悖论"正是在此期间被明确提出(Moravec, Mind Children, 1988)。
3. 行为主义时代(1986–2000s) Rodney Brooks 提出包容式架构(Subsumption Architecture, 1986):不建世界模型,用多层"感知-动作"模块直接耦合,上层行为抑制下层。代表成果 Genghis 六足虫。口号"Elephants don't play chess"直指符号主义脱离身体。同期 Khatib 的操作空间方法(1987)、ZMP 步态理论(Vukobratović, 1972)为控制奠基;本田 ASIMO(2000)展示精细双足行走。RoboCup(1997 起)与 DARPA 无人车挑战赛(2004/05,斯坦福 Stanley 夺冠)确立"竞赛驱动工程"模式。
4. 学习主义时代(2012–2021) 深度学习从视觉(AlexNet, 2012)蔓延到机器人:深度 RL(DQN 2013/2015)→ 操作领域 QT-Opt(Google, 2018,58 万次抓取)与 OpenAI Dactyl(2018-19,转魔方)→ 足式运动 RL 爆发(ETH: Science Robotics 2019 论文 + 2021 GPU 并行仿真 Isaac Gym,分钟级训练步态)。Sim2Real 与域随机化(Tobin 2017 等)成为标准工具。
5. 基础模型/VLA 时代(2022–至今) Google RT-1(2022)把机器人控制表述为序列建模;RT-2(2023)证明 VLM 权重可迁移出语义泛化;ALOHA/ACT(2023)把低成本精细操作数据采集变成开源运动;Open X-Embodiment 联盟(2023,22 种具身、100 万+轨迹)确立"数据是护城河";Physical Intelligence π0(2024,流匹配动作生成)、OpenVLA(2024,7B 开源)、NVIDIA GR00T N1 与 Figure Helix(2025,双系统)陆续登场。中国团队(宇树、智元等)以低成本硬件与开源策略大规模入场。
原理与机制
理解历史的钥匙是三个反复出现的钟摆:
- 建模 vs 不建模:符号主义建显式世界模型 → 行为主义弃模型直接反应 → 学习主义重新学隐式模型(世界模型,kp-306)。
- 专用 vs 通用:每个任务写程序 → 训练单一任务的专用策略 → 跨任务跨具身的通用策略(VLA)。
- 数据稀缺 vs 数据富集:早期靠人类专家设计 → RL 靠奖励自己探索 → 今天的核心瓶颈重新回到"如何廉价获得高质量交互数据"(kp-403、kp-406)。
公式与图示
1948──1960──1986────2000────2012────2018──2022──2023──2024──2025
│ │ │ │ │ │ │ │ │ │
电子龟 Shakey 包容式 ASIMO 深度学习 Dactyl RT-1 RT-2 π0 GR00T
Walter SRI Brooks Honda AlexNet QT-Opt OXE Helix
STRIPS ZMP/DGC DQN/RL IsaacGym ALOHA OXE
直观类比
把四个流派想成四种学游泳的方式:控制论是"教练喊口令你照做";符号主义是"背下泳姿教科书再下水";行为主义是"扔进水里扑腾出本能";学习主义是"看一万小时游泳视频然后模仿"。今天的共识:四种都需要,分层各司其职。
实例与案例
- DARPA Grand Challenge(2004/2005):第一届无一完赛;第二年 Stanley 完赛夺冠。五年内从"不可能"到"可用"——硬件并非瓶颈,瓶颈是感知与决策软件,预示了后来自动驾驶与具身智能的人才迁移。
- Boston Dynamics Atlas 退役液压版(2024)转电动版:执行器技术路线更替的活样本(kp-501)。
- ALOHA 开源(2023):一次论文级开源直接催生了全球高校的低价灵巧操作实验室——开源数据/硬件对领域的塑造力不亚于任何单篇算法论文。
常见误区
- 误区一:行为主义"过时了"。它的核心洞见——智能可以在感知-动作紧耦合中涌现、不必先建完整世界模型——在今天的反应式策略与双系统架构中全面复活。
- 误区二:历史是线性的进步史。每次范式都解决上代问题又引入新问题;RL 时代 sample inefficiency 的问题正是模仿学习 + 大数据时代试图回答的。
- 误区三:只看美国视角。工业机器人(日本发那科/安川)、协作臂(丹麦 UR)、足式与人形的成本曲线(中国供应链)都是全球共同推动的。
自测题
- 用一段话分别概括四个流派的核心主张,并各举一个代表系统。
- 包容式架构与现代"分层策略"有什么异同?
- Open X-Embodiment 之于机器人学,类比 NLP 领域的哪个事件?它改变了什么?
与其他知识点的关系
- kp-204 步态与全身控制:ZMP/LIPM/WBC 等历史遗产的工程现状。
- kp-305 VLA:当前时代的完整技术细节。
- kp-404 数据集生态:OXE 联盟的技术细节。
延伸阅读
- Brooks, R. Elephants Don't Play Chess. 1990。
- Moravec, H. Mind Children, 1988。
- Open X-Embodiment Collaboration. Open X-Embodiment: Robotic Learning Datasets and RT-X Models. ICRA 2024。
- 纪录片/长文:IEEE Spectrum 对 Boston Dynamics、ETH RSL 的多年追踪报道。
本节引用来源
- Brooks, A Robust Layered Control System, 1986
- Open X-Embodiment Collaboration, 2023