学习路径

总时长约 14 周(每周 6~8 小时),可按背景压缩或拉伸。每个阶段配"读 + 做"两类动作;站点首页进度条与知识地图会记录你的完成状态。

阶段 0 · 入门(第 1~2 周):建立全局心智模型

目标:能用 5 分钟向外行讲清"具身智能是什么、为什么难、现在为什么火"。

通过标准:能画出闭环框图并标注各层典型频率;能说出 Moravec 悖论。

阶段 1 · 核心机制(第 3~7 周):感知与控制两条主线

目标:理解一台机器人"看得见、站得稳、抓得住"背后的经典机制,能读参数手册与论文中的系统描述。

动手项目(二选一):

  1. 用 roboticstoolbox-python 或 MuJoCo 求解 6 轴机械臂逆运动学,画工作空间;实现一个简单 RRT 避障规划。
  2. 跑通 ROS 2 + Nav2 的 TurtleBot3 仿真导航,理解 costmap 与全局/局部规划器分工。

通过标准:能解释"为什么接触任务不能只用位置控制";能讲出 SLAM 的回环检测作用。

阶段 2 · 学习范式(第 8~11 周):当前主流方法栈

目标:掌握模仿学习与 RL 两条训练路线,能读懂 2023~2025 代表论文并复现小实验。

动手项目(强烈建议至少做一个):

  1. 数据 + 模仿学习全流程:买/借一个 SO-100 或用仿真,用 LeRobot 采集 50~100 条遥操作演示,训练 ACT 或 Diffusion Policy,部署回真机/仿真,记录成功率与失败模式。
  2. RL locomotion:用 Isaac Lab 或 legged-gym 训练四足速度跟踪策略,做域随机化,观察 Sim2Real 差距(有真机则迁移)。

通过标准:能解释协变量偏移与 DAgger 的关系;能说出 Diffusion Policy 相对 MSE 回归的优势。

阶段 3 · 数据、系统与前沿(第 12~14 周起,长期)

目标:建立"数据是护城河"的系统观,跟踪前沿并形成自己的判断。

长期习惯:订阅 CoRL/RSS/ICRA 论文列表与 Physical Intelligence、LeRobot、Figure、宇树的发布;每月读 2 篇新论文并更新笔记。

不同背景的捷径

背景建议
软件工程师 / ML 背景阶段 0 快速过,控制线只读 kp-201/203 直觉部分,重点压在阶段 2 与 kp-40x
机械 / 硬件背景阶段 1 控制线为主,感知线选读 kp-102/105;阶段 2 先 kp-301/303
学生打基础全序推进,阶段 1 配合《Modern Robotics》《视觉SLAM十四讲》补理论
只想建立产业判断kp-001~005 + kp-305 + kp-404/406 + kp-503 + kp-603/604,约 2 周

自检里程碑

  • [ ] 能画出感知-决策-行动闭环并标注频率分层(阶段 0)
  • [ ] 能解释阻抗控制为什么适合接触任务(阶段 1)
  • [ ] 完成一次"采集 → 训练 → 部署 → 评估"闭环(阶段 2)
  • [ ] 能对任一新款 VLA 模型论文做 10 分钟结构化点评(阶段 3)