世界模型与具身 AGI:物理 AI 的学术定义与产业路线图
综合上海 AI 实验室、南洋理工、NVIDIA、智元等机构最新研究,梳理世界模型定义、世界-动作模型与具身 AGI 分级…
在阿里云栖大会上,CEO 吴泳铭提出「未来机器的思考总量将超过人类 1000 倍以上,机器将承担 99.9% 的思考工作」,并把当下的 AI Coding 比作「1882 年的电灯」。围绕 AI 模型、AI 芯片、AI 云三大基石,阿里披露 Qwen 下一代模型参数将达 5–10T,平头哥发布真武 V900(算力为 M890 的 3 倍、单集群可扩展 50 万卡),并规划 2032 年阿里云数据中心规模超过 20GW。在大佬们畅想 ASI 的同时,学术界正把「超智能」从口号拆解为可执行的工程图纸,世界模型、具身 AGI 与垂直超级智能三条路径同步推进。
世界模型为什么是 AGI 的「身体」
上海 AI 实验室物理智能团队给出了相对克制的定义:世界模型是在有限计算资源约束下,对物理世界状态转移过程的压缩建模。这里的关键词是「压缩」而非「生成」——核心任务是把高维、冗余、充满噪声的物理观测蒸馏成紧凑、可用的物理表征,视频生成只是顺带涌现的能力。
由此派生三大属性:全模态(视觉、听觉、触觉等同时建模)、多维异步性(不同维度采样频率天然不同)、局域性(智能体只能观测局部,外部影响只能是干预,本质上是一个 POMDP)。团队还强调「数据决定上限」:任何智能系统在物理世界的泛化能力上限,由训练数据的物理多样性决定,而非模型结构本身。
世界-动作模型:从「看到就做」到「先想象再行动」
如果说世界模型是物理世界的大脑,机器人还需要一个把想象变成动作的接口。世界-动作模型(World Action Model,WAM)就此出现:它在动作决策前先预测「这样做下去世界会变成什么样」,把机器人从「条件反射」推向「谋定后动」。
近三个月这条赛道密集发布新品:
- NVIDIA Cosmos 3:用一个统一的混合专家 Transformer 架构,把语言、图像、视频、音频、动作五种模态塞进同一模型,宣称一个框架同时承担视觉语言模型、视频生成器、世界模拟器和世界-动作模型。
- 智元 GE-Act 2.0:首个从随机初始化开始、在具身数据上从头训练、不针对评测任务微调的「原生」世界-动作模型。其自研 CoAE 编码器把一帧 256×384 画面压缩成 24 个 token,仅为 DINOv3 的 1/16,在 RTX 5090 上生成一个动作块只需 104 毫秒。
- 智元验证了「机器人 Scaling 定律」:把训练数据从 300 小时拉到 3 万小时(100 倍),机器人在陌生场景零样本测试中能完成的精细任务从 39 项跃升至 76 项。
数据工作流与大规模实践
Scaling 的前提是数据。「倒置金字塔工作流」给出了方法论:先用数十亿量级的互联网视频解锁物理先验,再逐层过滤、合成、提纯,最终得到任务对齐的真实数据——专有机器人数据在多样性上很难与互联网竞争。
代表性实践包括:
- 智元与上海创智学院联合发布的 τ0-WM:在约 27,300 小时异构语料上预训练(含 17,800 小时真机遥操作、6,500 小时 UMI、3,000 小时第一人称人类视频),模型仅 5B 参数,把「动作生成」「视频预测」「任务评估」统一进同一共享预测表示。推理时采样多个候选动作,用动作条件视频模拟器「预演」未来并挑选最优。
- 海外 Riemann-1.0:用 200K+ 小时交互数据,把「可执行机器人策略」与「多本体视觉世界模拟器」融入同一个自回归模型,在 RoboTwin 2.0 上达到 94.3%、LIBERO 上 99.0% 的成功率。
具身 AGI 分级:仍处于 L1 至 L2
南洋理工大学的综述参考自动驾驶分级,提出了具身 AGI 的五级路线图:L1 单任务完成、L2 组合任务完成、L3 有条件通用任务、L4 高度通用、L5 全天候自主全能机器人。论文结论清醒地指出:当前所有具身智能系统仍处在 L1 至 L2 之间。
四个衡量维度为:全模态能力、类人认知、实时响应、开放任务泛化。其中最难的是类人认知——自我意识、社交连接理解、程序性记忆、记忆重构,都难以靠监督学习或强化学习习得,需要模型在部署后持续更新内部状态(终身学习)。这正是「具身 AGI」与「聊天 AGI」的本质区别。
垂直超级智能:网络安全先行的 ASI 样本
AGI 是「广度」,ASI 也可以是「深度」。Alias Robotics 的论文以网络安全为例,给出三阶段演进:
- PentestGPT:AI 辅助人类做渗透测试;
- Cybersecurity AI(CAI):AI Agent 达到专家级水平,以 3,600 倍于人类的速度、1/156 的成本完成安全任务;
- G-CTR:将博弈论(纳什均衡)装进 LLM Agent,在攻防对抗中实现成功率翻倍、行为方差降低 5.2 倍。
随着攻防双方都部署博弈论 AI,网络安全正从「人机协作」走向「算法军备竞赛」,人类角色也从执行者、操作者逐步退居监督者。
通往物理 AGI 的分阶段路线
业界对下一代世界模型的共识路线是:先做统一多模态世界模型,再形成「统一物理表征」(一个状态,多个解码器——渲染、模拟、规划都从同一压缩状态解码),最终构建基础规模交互式模拟器。
这条路的难点同样明确:能量消耗、真实性与精度的权衡、长时间预测的误差累积、从仿真到现实的鸿沟。更本质的担忧是,当世界模型足够强、机器人足够通用,人机关系是否会重演网络安全里的「角色反转」——人类从执行者退居监督者,智能体则在物理世界里越跑越快。
资料来源:上海人工智能实验室《世界模型定义与路线图》;新加坡南洋理工大学《走向具身 AGI:具身 AI 综述与前方道路》;Alias Robotics《迈向网络安全超级智能》;NVIDIA《Cosmos 3:面向物理 AI 的全模态世界模型》;智元机器人《GE-Act 2.0 发布说明》;上海创智学院《τ0-WM:最大规模预训练具身世界模型》;Riemann-1.0《面向物理 AI 的具身世界-动作模型》;北京智源《2026 十大 AI 技术趋势》。
