桃子桃子快讯
返回首页
行业动态

世界模型成具身智能新基座,Manifold AI 提出物理为中心新范式

Manifold AI 创始人在 2026 世界机器人大会上提出,具身智能下一阶段竞争焦点从任务模型转向世界模型。

2026.08.24 · 周一4 分钟阅读

在 2026 世界机器人大会上,Manifold AI 流形空间创始人武伟围绕「以物理为中心的世界模型新范式」发表演讲。他认为,具身智能正在进入新的发展阶段:行业竞争的重点不再是让机器人完成更多单点任务,而是让同一套智能在变化的环境、本体和任务之间迁移。过去 Scaling 更多被理解为扩大参数规模、增加数据或覆盖任务;在物理世界中,模型还必须理解环境变化、预测动作后果,并把预测转化为行为,世界模型由此成为新的基础层。

从「完成任务」到「在变化中泛化」

当前的机器人系统仍大量依赖专用模型。在结构化环境里,系统可以完成预设动作;但当物体形态、场景或控制方式发生变化时,往往需要重新采集数据、训练和调试。武伟把问题指向了基础模型层:具身智能缺少的不是更多彼此割裂的任务模型,而是能够学习物理规律、预测环境演化并支持动作规划的世界模型。生成式预训练也因此开始从语言和图像生成,走向时空理解与物理推演,让模型根据当前观测和动作预测未来状态,再生成机器人下一步的行动。

世界模型的合格线,不是「看起来真实」

如果世界模型要成为具身智能的基座,视觉逼真远远不够。一个画面看起来合理,并不代表状态演化符合物理规律。模型还要处理跨视角一致性、三维空间结构、接触关系和动作后果,才能真正服务于机器人训练、策略评估和长流程规划。据现场分享,Manifold AI 先后在自动驾驶和机器人环境中探索世界模型的物理可控性:

  • DriveScape:关注多摄像头视角对齐、长时生成和物理规律注入;
  • RoboScape:把世界模型用于合成数据生成和策略评估,探索如何减少机器人对大规模真实数据的依赖。

武伟强调,评价方式也必须随之改变:视频是否清晰只是第一层指标,更重要的是合成环境能否训练出有效策略,模型预测能否与真实状态变化一致,以及能否支持多步交互。世界模型的价值,最终要落到「物理上是否成立、功能上是否有效」。

统一 MoE 架构与数据闭环

在架构设计上,Manifold AI 的 WorldScape 采用统一的 MoE(Mixture of Experts,混合专家)架构:共享专家学习共同的世界动力学,同时为移动、手部动作、相机轨迹和机械臂操作保留专门能力,再回到统一的环境建模过程。在动作生成层面,世界模型回答「接下来会发生什么」,WorldScape Policy 进一步回答「接下来应该做什么」。由于让一个模型零样本泛化到所有任务仍然困难,团队把 In-Context Learning(上下文学习)视为中间状态:机器人可以根据语言、目标图像或人类操作视频理解任务,在不重新微调参数的情况下调整行动。

现场展示了柔性 SKU 分拣、毫米级孔位对齐、飞机盒处理和衣物折叠等任务,体现机器人根据新指令、目标状态或示范视频完成模仿与推理的方向。在这条链路中,WorldData 沉淀并回流物理世界经验,WorldScape 理解和预测环境变化,WorldScape Policy 将预测转化为行动,部署数据再回到训练管线,核心是让一次训练形成的能力在更多任务、本体和场景中复用。

评测体系需要从视频走向真实功能

随着世界模型开始承担数据生成、策略评估和行动规划,评测体系也必须同步变化。Manifold AI 推出的 WorldArena 把模型放到这些真实功能中检验,WorldArena 2.0 进一步探索视觉—触觉联合建模、在线强化训练和真实具身场景,评价重点也从「视频是否真实」扩展到「模型是否理解接触、空间和动作后果」。武伟也指出,世界模型现阶段仍不能完全替代真实模拟器,sim-to-real 差距依然存在,但它已成为连接数据、模型与机器人执行的基础层。具身智能的竞争可能由单点 Demo 转向基础能力复用:同一套模型跨任务、跨本体、跨场景迁移,并通过部署持续积累经验。

信源