世界模型架构综述(2018–2026)
一份覆盖世界模型架构谱系与前沿方向的系统性综述,提出两层定义并梳理 12 类架构家族与 4 类应用方向。
世界模型(world model)被视为继大语言模型(LLM)之后的下一前沿方向,但学界与业界对其定义尚未形成统一共识。独立研究者 Nathan Murthy 近日发布的一份长达数十节的综述《World Model Architectures: A Survey (2018–2026)》,从定义、架构家族、应用研究和开放问题四个维度,对 2018 年以来的世界模型工作做了系统性梳理。该综述由作者借助 Claude 与 Gemini 协作完成,文中坦承其分类标准为作者个人提出的「自用分类法」,未必被权威来源正式采纳。
核心定义:两类世界模型
综述给出了一个两层定义:
- Type I:动力学模型(dynamics models)。对可观测系统的因果动力学建模,给定系统状态(或对状态的观测)预测其下一状态,形式化为 p(s' | s),从数据中学习而非由第一性原理手工指定。系统可以是游戏、房间、大气、设备、细胞或分子集合。
- Type II:动作条件动力学模型(action-conditioned dynamics models)。在 Type I 基础上额外以人类、智能体或机器对系统的干预为条件,形式化为 p(s' | s, a),对应基于模型的强化学习(model-based RL)设定,是规划、控制与反事实推理的基础。
作者认为 Type II 是 Type I 的严格子集,其判断关键在于模型是否提供「动作 / 干预接口」,例如显式动作向量(TD-MPC2、V-JEPA 2-AC)、从无标签视频中推断的潜动作(Genie)、自然语言动作(PAN)、托卡马克线圈电压与束功率调整、活细胞扰动(X-Cell)等。综述也指出两类边界外的情况:仅预测平衡构象的静态条件映射(如 AlphaFold 类结构预测)和从学习分布中采样的生成式设计器(如 ESM3、Chroma、ProGen3),前者无时间轴可推演,后者只是采样而非模拟。
12 类架构家族与谱系
综述将当前世界模型划分为 12 个家族,并梳理其技术血缘:
- 物理机器学习:电机与物理化学方向。
- VAE / 生成式潜空间:以 Dreamer 系列为代表的潜变量强化学习谱系。
- Var-JEPA 桥接:从变分自编码器向联合嵌入预测架构过渡的桥梁工作。
- JEPA:联合嵌入 / 潜变量预测架构(Yann LeCun 长期推动的方向)。
- 解码器无关潜空间 + MPC:TD-MPC 谱系,结合模型预测控制。
- 基于搜索的世界模型:MuZero 谱系,将搜索与学习结合。
- Token / Transformer 世界模型:在大模型范式下构建世界模型。
- 生成式视频 / 交互式世界模型:用于可交互场景的视频生成方向。
- 地球系统模型:天气与气候建模。
- 核物理:聚变与裂变建模。
- 分子与生物化学模型:从蛋白质设计到生化系统。
- 人类与社会行为系统:建模人群与社会动力学。
综述同时指出,理解「模型架构」与「世界模型」之间的差异很重要:CNN、RNN、LSTM、VAE、Transformer、扩散模型等只是构建模块,能否构成世界模型取决于其是否具备可推演的状态演化能力以及可选的动作干预接口。
应用研究方向
综述挑选了与作者经验相关的四个应用方向:
- 机器人:世界模型被视为机器人决策与控制的底座。
- 天气预报:地球系统模型在短期与中长期预报上的应用。
- 工业系统与能源:包括电力系统、工业流程优化等。
- 数学发现:用世界模型框架辅助数学问题的探索。
开放问题:VAE、JEPA 与 PAN 之争
综述在最后一节提出当前值得关注的架构之争:VAE 路线、JEPA 路线与 PAN(自然语言动作)路线各自代表不同的世界建模范式,三者在表征学习方式、干预接口设计和训练目标上各有取舍,仍是开放问题。作者在文末强调,文献中关于「什么算世界模型」的争论焦点正在从「是否是世界模型」转向「模型的状态与动作预测能向前推演多远」这一更可操作的问题。
