世界模型与学习式预测
一句话定义
世界模型(World Model)让智能体在"脑内"学习一个环境预测器:给定当前状态与动作,预测世界会怎样变化——于是它可以像做梦一样在想象中练习(model-based RL)、规划与评估,而不必事事都碰真实世界。
为什么重要
- 直击具身智能的根本瓶颈:真实交互数据太贵。若模型能在想象中产生可靠的经验,数据经济学的差距(kp-002)有望被缩小一个数量级。
- 它是"视频生成模型是否通往具身智能"这场大讨论的技术内核:Sora、Genie、Cosmos 都在这个谱系上。
- Yann LeCun 的"世界模型是通往 AGI 之路"主张使它成为公众视野里的核心叙事;工程上 Dreamer 系已证明其数据效率优势。
前置知识
kp-302 RL;生成模型基础。
核心概念
概念源头:Sutton 的 Dyna(1991)——"模型内模拟经验 + 真实经验"混合训练;Ha & Schmidhuber 的 World Models(2018)——VAE+RNN 在"梦里"开赛车;LeCun JEPA 主张(2022)——预测表征而非像素。
两条技术路线:
- 潜空间世界模型(Dreamer 系):RSSM(随机隐变量 + RNN)压缩观测为潜状态 $z_t$,学习 $p(z_{t+1}|z_t, a_t)$;策略在潜空间 rollout 中训练。DreamerV3(2023,后登 Nature 2025)一个超参集横扫 150+ 任务,包括 Minecraft 钻石收集——model-based RL 数据效率标杆。TD-MPC2 系把潜空间模型与 MPC(kp-205)结合。
- 视频世界模型:直接预测未来帧。Genie(2024):从无标注游戏视频学"潜在动作"生成可交互世界;Genie 2(2024)从单张图生成 3D 可玩世界;NVIDIA Cosmos(2025):定位为"机器人/自驾的世界基础模型",提供可控物理一致性的视频生成;1X 等人形公司用世界模型做策略的"脑内验收"。
三大用途:
- 想象训练(Dyna 式):策略在世界模型里试错;
- 预测规划:MPC 的 $f$ 用世界模型替代(kp-205);
- 评估与数据扩增:模型生成新场景/物体位置,扩充策略训练数据(GR00T 的 Neural Trajectories 思路)。
原理与机制
Dreamer 训练循环:
真实交互(少量) ─► 训练 RSSM(重构+奖励+KL)
│
▼
潜空间想象 rollout(z1→z2→...→zH,几十步)
│
▼
Actor-Critic 在想象轨迹上训练策略 π(a|z)
│
└────► 少量真实交互验证/再采集(闭环)
为什么省数据:梯度可以穿过学习到的模型反向传播(backprop through imagination),策略训练不再消耗真实环境步。
复合误差问题:想象 rollout 越长,模型误差累积越大,想象与现实的分布偏差(model bias)会污染策略——时域长度 H 与模型质量的权衡是此类方法的核心工程问题。接触丰富场景的物理突变是视频世界模型的公认软肋。
公式与图示
RSSM 单步(简化):
$$h_t = f_\phi(h_{t-1}, z_{t-1}, a_{t-1}), \qquad z_t \sim q_\phi(z_t \mid h_t, o_t)$$
训练目标:重构 $o_t$ + 预测奖励 + KL 正则($q$ 与先验 $p(z_t|h_t)$ 对齐)。
想象(脑内) 现实(昂贵)
┌─────────────────────┐ ┌──────────────────┐
│ z ──动作──► z ──► … │ │ 真机器人 交互 │
│ 策略在梦里练习千次 │ ──校准─►│ 每次都要时间/风险 │
└─────────────────────┘ └──────────────────┘
直观类比
- 下棋复盘:棋手在脑内推演"如果走这步会怎样"——脑内棋盘就是世界模型;复盘(真实对局)校准脑内模型。
- 新手司机 vs 老司机:新手每个动作都要真实反馈确认;老司机在脑内已经"开过"一万遍,真实世界只是验证想象——世界模型把交互成本变成了计算成本。
实例与案例
- DreamerV3:单一配置从零学会 150+ 任务;首个无人类数据收集 Minecraft 挖到钻石的模型。
- Cosmos(NVIDIA, 2025):为机器人提供"世界基础模型"底座 + 合成数据管线(文本/图像/视频 → 可控物理场景),与 GR00T 策略模型配套。
- 1X 世界模型(2024-25):人形机器人公司用视频世界模型评估策略在真实家庭中"会做什么",把世界模型当 CI 测试用——世界模型作为评估器的务实落地。
- 自动驾驶平行:Wayve GAIA 系列、Tesla 端到端 + 生成式仿真,与机器人世界模型同构,人才与方法双向流动。
常见误区
- 误区一:视频生成=世界模型。画面好看不等于动作-后果因果正确;物理一致性(接触、遮挡后状态)才是机器人可用世界模型的门槛,当前(2025)仍是研究前沿。
- 误区二:世界模型取代真机数据。模型本身要靠真实数据训练与校准;正确定位是"放大器"——少量真数据在想象中膨胀,不是替代。
- 误区三:潜空间模型与视频模型之争有胜负。潜空间路线胜在控制学习效率,视频路线胜在先验丰富(互联网视频),两者正在合流(视频骨干 + 潜动作)。
自测题
- 解释 Dyna 框架:真实经验与想象经验各承担什么角色?
- 为什么想象 rollout 不能无限长?复合误差如何影响策略质量?
- 判断一个视频生成模型能否当"机器人世界模型",应设计什么测试?
与其他知识点的关系
- kp-205 MPC:世界模型是其 $f$ 的学习式版本。
- kp-402 Sim2Real:世界模型是"可学习的仿真器",与物理引擎仿真互补。
- kp-305 VLA:VLA 管行动,世界模型管想象,两者组合是当前最被看好的完整闭环。
延伸阅读
- Hafner et al., Mastering Diverse Domains through World Models(DreamerV3, Nature 2025)。
- Ha & Schmidhuber, World Models, 2018(可读性极佳的起点)。
- LeCun, A Path Towards Autonomous Machine Intelligence, 2022(JEPA 立场文)。
本节引用来源
- Hafner et al., DreamerV3, 2023
- Bruce et al., Genie, 2024