领域总览
这是什么
具身智能(Embodied AI / Embodied Intelligence)研究拥有物理或虚拟身体的智能体如何通过感知、决策与行动,在与环境的交互中完成任务并习得智能。它把"智能"从纯计算问题拉回到"身体—大脑—环境"三元闭环:智能体不只是看懂世界,还要动手改变世界。
2022 年以来,视觉-语言-动作模型(VLA)、低成本遥操作数据采集、GPU 并行仿真三条线同时爆发,让具身智能从"机器人学的一个分支"变成大模型之后最受关注的 AI 方向。本知识库覆盖从经典控制论到 2025 年前后产业与学术前沿的完整版图。
为什么现在学
- 范式切换窗口:机器人领域正从"为每个任务写程序"转向"训练通用策略",方法栈(模仿学习、RL、VLA、世界模型)与 NLP/CV 大模型正在合流。
- 门槛骤降:约 $100 级开源机械臂(SO-100)、免费仿真(MuJoCo、Isaac Lab)、开源策略库(LeRobot),个人可以完整走一遍"采数据 → 训练 → 部署"。
- 产业落地启动:仓储物流、工厂质检/搬运等场景已出现人形机器人商用试点;具身算法工程师成为高需求岗位。
知识树(七个模块,37 个知识点)
| 模块 | 编号 | 内容 | 知识点 |
|---|---|---|---|
| 01 基础与全景 | kp-001~005 | 定义、与非具身 AI 的分野、感知-决策-行动闭环、发展史、形态谱系 | 5 |
| 02 感知 | kp-101~105 | 多模态传感器、3D 视觉、SLAM、触觉力觉、本体感知与状态估计 | 5 |
| 03 运动与控制 | kp-201~206 | 运动学动力学、轨迹规划、柔顺控制、步态与全身控制、MPC、RL 控制 | 6 |
| 04 学习范式 | kp-301~307 | 模仿学习、深度 RL、Diffusion Policy、ACT/ALOHA、VLA、世界模型、LLM 规划 | 7 |
| 05 数据仿真与评估 | kp-401~406 | 仿真平台、Sim2Real、遥操作采集、开源数据集、评估基准、数据飞轮 | 6 |
| 06 系统工程 | kp-501~504 | 硬件解剖、机械臂/灵巧手、人形机器人产业、软件栈与 ROS 2 | 4 |
| 07 前沿与展望 | kp-601~604 | 长程任务与导航、泛化难题、安全伦理、落地路径与学习资源 | 4 |
每个模块的视觉主题色不同(青/紫/琥珀/粉/绿/蓝/橙),站点中的知识地图按依赖关系绘制。
学习目标(完成本库后你应能)
- 讲清楚:具身智能与传统 AI、大语言模型的本质差异;感知-决策-行动闭环的分层结构。
- 看懂论文:读懂 RT-2、π0、Diffusion Policy、ALOHA/ACT 等代表作的方法与实验设计。
- 动手做:在 MuJoCo/Isaac Lab 中训练一个运动或操作策略;用开源臂 + LeRobot 采集数据并训练模仿学习策略;理解 Sim2Real 的完整流程。
- 建立判断力:对"人形机器人元年""通用机器人 ChatGPT 时刻"等叙事做出有依据的评估;识别常见误区(如"有 LLM 就能当机器人大脑")。
前置知识建议
- 数学:线性代数(矩阵、特征值)、微积分(梯度、链式法则)、概率基础(期望、高斯分布)。
- 编程:Python(NumPy);想动手训练则需 PyTorch 基础。
- 可选加分:经典力学(力、力矩)、深度学习基础(CNN、Transformer)。
没有这些基础也能读完入门与核心层(各节均有直觉解释),动手实践部分建议边学边补。
边界说明
- 本库以物理具身(机器人)为主线;"虚拟具身"(游戏智能体、具身问答、虚拟世界智能体)作为延伸在 kp-001 与 kp-306 提及,不展开。
- 不覆盖:机械设计 CAD 与加工工艺、传感器底层电路设计、SLAM 理论的完整推导(只讲工程视角的核心机制)。
- 内容以公开文献与开源项目为主,编写基线约为 2025 年中;更新极快的部分(人形机器人产业、VLA 模型)建议结合最新论文与厂商公告核对。