世界模型与学习式预测

前沿 学习范式 kp-306 世界模型Dreamer视频生成预测学习

一句话定义

世界模型(World Model)让智能体在"脑内"学习一个环境预测器:给定当前状态与动作,预测世界会怎样变化——于是它可以像做梦一样在想象中练习(model-based RL)、规划与评估,而不必事事都碰真实世界。

为什么重要

  • 直击具身智能的根本瓶颈:真实交互数据太贵。若模型能在想象中产生可靠的经验,数据经济学的差距(kp-002)有望被缩小一个数量级。
  • 它是"视频生成模型是否通往具身智能"这场大讨论的技术内核:Sora、Genie、Cosmos 都在这个谱系上。
  • Yann LeCun 的"世界模型是通往 AGI 之路"主张使它成为公众视野里的核心叙事;工程上 Dreamer 系已证明其数据效率优势。

前置知识

kp-302 RL;生成模型基础。

核心概念

概念源头:Sutton 的 Dyna(1991)——"模型内模拟经验 + 真实经验"混合训练;Ha & Schmidhuber 的 World Models(2018)——VAE+RNN 在"梦里"开赛车;LeCun JEPA 主张(2022)——预测表征而非像素。

两条技术路线:

  1. 潜空间世界模型(Dreamer 系):RSSM(随机隐变量 + RNN)压缩观测为潜状态 $z_t$,学习 $p(z_{t+1}|z_t, a_t)$;策略在潜空间 rollout 中训练。DreamerV3(2023,后登 Nature 2025)一个超参集横扫 150+ 任务,包括 Minecraft 钻石收集——model-based RL 数据效率标杆。TD-MPC2 系把潜空间模型与 MPC(kp-205)结合。
  2. 视频世界模型:直接预测未来帧。Genie(2024):从无标注游戏视频学"潜在动作"生成可交互世界;Genie 2(2024)从单张图生成 3D 可玩世界;NVIDIA Cosmos(2025):定位为"机器人/自驾的世界基础模型",提供可控物理一致性的视频生成;1X 等人形公司用世界模型做策略的"脑内验收"。

三大用途:

  • 想象训练(Dyna 式):策略在世界模型里试错;
  • 预测规划:MPC 的 $f$ 用世界模型替代(kp-205);
  • 评估与数据扩增:模型生成新场景/物体位置,扩充策略训练数据(GR00T 的 Neural Trajectories 思路)。

原理与机制

Dreamer 训练循环:

真实交互(少量) ─► 训练 RSSM(重构+奖励+KL)
                     │
                     ▼
      潜空间想象 rollout(z1→z2→...→zH,几十步)
                     │
                     ▼
      Actor-Critic 在想象轨迹上训练策略 π(a|z)
                     │
                     └────► 少量真实交互验证/再采集(闭环)

为什么省数据:梯度可以穿过学习到的模型反向传播(backprop through imagination),策略训练不再消耗真实环境步。

复合误差问题:想象 rollout 越长,模型误差累积越大,想象与现实的分布偏差(model bias)会污染策略——时域长度 H 与模型质量的权衡是此类方法的核心工程问题。接触丰富场景的物理突变是视频世界模型的公认软肋。

公式与图示

RSSM 单步(简化):

$$h_t = f_\phi(h_{t-1}, z_{t-1}, a_{t-1}), \qquad z_t \sim q_\phi(z_t \mid h_t, o_t)$$

训练目标:重构 $o_t$ + 预测奖励 + KL 正则($q$ 与先验 $p(z_t|h_t)$ 对齐)。

         想象(脑内)                    现实(昂贵)
   ┌─────────────────────┐        ┌──────────────────┐
   │ z ──动作──► z ──► …  │        │ 真机器人 交互      │
   │ 策略在梦里练习千次     │ ──校准─►│ 每次都要时间/风险  │
   └─────────────────────┘        └──────────────────┘

直观类比

  • 下棋复盘:棋手在脑内推演"如果走这步会怎样"——脑内棋盘就是世界模型;复盘(真实对局)校准脑内模型。
  • 新手司机 vs 老司机:新手每个动作都要真实反馈确认;老司机在脑内已经"开过"一万遍,真实世界只是验证想象——世界模型把交互成本变成了计算成本。

实例与案例

  • DreamerV3:单一配置从零学会 150+ 任务;首个无人类数据收集 Minecraft 挖到钻石的模型。
  • Cosmos(NVIDIA, 2025):为机器人提供"世界基础模型"底座 + 合成数据管线(文本/图像/视频 → 可控物理场景),与 GR00T 策略模型配套。
  • 1X 世界模型(2024-25):人形机器人公司用视频世界模型评估策略在真实家庭中"会做什么",把世界模型当 CI 测试用——世界模型作为评估器的务实落地。
  • 自动驾驶平行:Wayve GAIA 系列、Tesla 端到端 + 生成式仿真,与机器人世界模型同构,人才与方法双向流动。

常见误区

  • 误区一:视频生成=世界模型。画面好看不等于动作-后果因果正确;物理一致性(接触、遮挡后状态)才是机器人可用世界模型的门槛,当前(2025)仍是研究前沿。
  • 误区二:世界模型取代真机数据。模型本身要靠真实数据训练与校准;正确定位是"放大器"——少量真数据在想象中膨胀,不是替代。
  • 误区三:潜空间模型与视频模型之争有胜负。潜空间路线胜在控制学习效率,视频路线胜在先验丰富(互联网视频),两者正在合流(视频骨干 + 潜动作)。

自测题

  1. 解释 Dyna 框架:真实经验与想象经验各承担什么角色?
  2. 为什么想象 rollout 不能无限长?复合误差如何影响策略质量?
  3. 判断一个视频生成模型能否当"机器人世界模型",应设计什么测试?

与其他知识点的关系

  • kp-205 MPC:世界模型是其 $f$ 的学习式版本。
  • kp-402 Sim2Real:世界模型是"可学习的仿真器",与物理引擎仿真互补。
  • kp-305 VLA:VLA 管行动,世界模型管想象,两者组合是当前最被看好的完整闭环。

延伸阅读

  • Hafner et al., Mastering Diverse Domains through World Models(DreamerV3, Nature 2025)。
  • Ha & Schmidhuber, World Models, 2018(可读性极佳的起点)。
  • LeCun, A Path Towards Autonomous Machine Intelligence, 2022(JEPA 立场文)。

本节引用来源

  • Hafner et al., DreamerV3, 2023
  • Bruce et al., Genie, 2024