桃子桃子快讯
返回首页
行业动态

世界模型六小龙 WAIC 同台论剑:技术路线、收敛点与落地之争

WAIC 圆桌汇聚六家世界模型公司技术负责人,围绕技术路线、下一阶段收敛点与从 Demo 走向部署展开激烈讨论。

2026.07.24 · 周五5 分钟阅读

7 月 19 日的 WAIC 现场,一场被称为「世界模型六小龙」的圆桌论坛引发关注。蚂蚁灵波、极佳视界、无界动力、智元机器人、自变量机器人和大晓机器人六家公司的技术负责人齐聚一堂,由大晓机器人首席科学家陶大程主持,围绕世界模型的技术路线、下一步收敛点以及落地部署三个核心问题展开了一场观点碰撞激烈的讨论。与 AI 圈内多数话题不同,世界模型在概念、技术路线、训练方式、数据标准与评测尺度上均尚未形成共识,而这种「非共识」恰恰被与会嘉宾视为行业当下的红利。

三条技术路线,三种世界观

论坛最核心的讨论围绕「模型在什么空间里推演世界」展开。与会六家公司按技术路线大致分为三派:

  • 像素生成派:以极佳视界为代表,模型直接在像素空间生成视频式推演,天然擅长「看起来合理」。
  • 隐空间(JEPA)派:以无界动力为代表,在隐空间中做预测,可直接回归几何、运动、力等物理量。
  • 融合派:包括大晓机器人(理解-生成-预测一体化)、蚂蚁灵波(多路线世界模型全家桶)、自变量机器人和智元机器人,尝试将不同路径整合到统一框架。

技术路线不同,对焦点问题的判断也随之分化。在「世界模型该对物理世界理解到什么程度」这一问题上,无界动力夏中谱认为应尽可能逼近物理模拟器,追求几何、运动、力的预测精度;蚂蚁灵波沈宇军则主张「物理合理性」优先于「物理精度」,机器人只需知道同等重量下铁比棉花落得快即可,无需精确计算。

在能力评价标准上,智元机器人任广辉强调「长时物理一致性」不可或缺,而自变量机器人王昊直言长程推演是「伪需求」,更看重推理时效性——若预测拖慢决策窗口,再完整的理解也失去意义。

下一步先收敛什么?

当被问及「世界模型下一阶段最可能先收敛的是什么」,四位嘉宾给出了截然不同的答案:

  • 任广辉和夏中谱押注「统一表征」:语言模型找到了 token,但具身智能尚未找到自己的 token,视觉、语言、动作等多模态仍需对齐。
  • 王昊押注「融合」:视频生成负责未来预测、隐空间负责推理、3D 显式建模充当空间记忆,各取所长拼出新架构。
  • 沈宇军押注「触觉」:下一阶段行业将率先形成共识,触觉将成为机器人不可或缺的模态;触觉数据一旦突破,物理世界与数字世界的世界模型将分道扬镳。

陶大程则提出另一种可能——收敛不会发生在某条技术路线上,而会发生在评测标尺上。正如 ImageNet 让深度学习各流派站到同一把尺子下,具身智能也需要一个统一的物理智能评测标准。论坛期间,大晓机器人顺势发布了 PHYSICAL IQ 平台,定位为首个具身原生、面向多场景多本体多任务的物理智能评测基准。

从 Demo 到 Deployment 的鸿沟

相比技术路线之争,所有嘉宾在一个问题上罕见一致:Demo 不难,难的是规模化部署。夏中谱称之为「决策有效性」,任广辉关注「policy 提升」,朱政则定义为「多任务真机成功率」,虽名称不同,目标却一致——机器人能否在真实环境中稳定完成任务。

王昊分享了一条经验规律:模型能力从 90% 提升到 99% 再到 99.9%,投入成本并非线性增长。实验室里看似微小的错误率,落到部署现场就可能变成一次次人工接管与返工。沈宇军补充了商超场景的例子:顾客顺手把蔬菜放进牛奶柜是偶发事件,却是机器人每天都要面对的日常。

陶大程特别强调了端侧能力的重要性:很多世界模型仍跑在云端,但机器人留给自己做判断的时间往往只有几十到几百毫秒,网络不能永远在线,云端也不能总在等待。「最难的不是让模型变聪明,而是让聪明变得便宜、可靠、及时。」他总结道,Demo 展示的是能力上限,部署考验的则是能力下限。

两年后回看:什么做对了?

论坛最后抛出一个开放问题:世界模型今年上半年才真正火起来,两年后回望,眼下什么做对了、什么做错了?

沈宇军认为,行业有时混淆「模型的能力」与「模型展现出来的能力」——前者是泛化效率、可交互性等内在属性,后者是生成效果等外在呈现。所有为架构能力做的工作都做对了,但过于追求外在呈现效果并不可一概而论;所有为数据链路做的准备也都做对了,但当下积累的数据最终能否被用到、能否被迭代更新,尚需观察。朱政提醒,基模尚未收敛时便急于探索过多商业化场景,大概率不会成功。任广辉则预期,两年后世界模型会更加「具身原生」,需要更大规模的具身原生数据与为具身而生的原生架构。

陶大程在总结中点出了这场讨论的价值所在:「分歧是论文的素材,重叠是产业的基底。」对整个行业而言,非共识不是问题,反而是当下最大的红利。

信源