桃子桃子快讯
返回首页
行业动态

WAIC圆桌实录:世界模型「六小龙」的技术路线之争

WAIC圆桌汇集六家国内具身智能公司,围绕世界模型的技术路线、能力评价、收敛方向与落地部署展开激辩。

2026.07.22 · 周三5 分钟阅读

在 2025 年 7 月 19 日的 WAIC(世界人工智能大会)「世界模型六小龙」论坛上,大晓机器人、蚂蚁灵波、极佳视界、无界动力、智元机器人、自变量机器人六家国内具身智能公司的技术负责人,围绕世界模型的技术路线、能力评价标准、下一步收敛方向以及从 Demo 走向规模化部署等议题,展开了一场高密度的圆桌讨论。主持人由大晓机器人首席科学家陶大程担任。与会嘉宾坦诚交锋了行业最前沿的分歧与共识。

技术路线之争:三派分立

圆桌首先将六家公司按「模型在什么空间里推演世界」划分成三派:

  • 像素生成派:以极佳视界为代表,模型直接在像素空间生成未来画面。
  • 隐空间(JEPA)派:以无界动力为代表,借助表征空间预测物理量。
  • 融合派:包括大晓机器人(理解–生成–预测一体化)、蚂蚁灵波(多路线「世界模型全家桶」)、智元机器人和自变量机器人。

路线差异直接导致对「世界模型究竟该理解到什么程度」的看法分歧。无界动力 CTO 夏中谱主张看几何、运动、力等状态的预测精度,让模型尽可能逼近物理模拟器;蚂蚁灵波首席科学家沈宇军则认为「物理合理性」比「物理精度」更重要——机器人只需知道同重量的铁比棉花落得快,而不必算出具体差值。

能力评价:长程一致性还是推理时效

对模型能力的评价标准,嘉宾同样针锋相对。智元机器人 AI 算法总监任广辉认为,长时物理一致性是必备指标;自变量机器人 CTO 王昊则直言长程推演是「伪需求」,更看重推理时效——一旦慢到错过决策窗口,再完整的理解也无意义。

背后的逻辑是各家公司技术强项不同:隐空间路线可直接回归物理量,所以敢要求精度;像素生成路线天然学到「看起来合理」,所以只承诺合理性;智元把世界模型当仿真器用,长程推演是其生命线;自变量则把世界模型与 VLA 整合进同一端到端框架,预测是动作生成的前置环节。

下一阶段,什么会率先收敛

关于世界模型最先收敛的部分,嘉宾给出不同押注:

  • 统一表征:任广辉、夏中谱认为关键在于找到具身智能的「token」,把视觉、语言、动作对齐进同一表征。
  • 融合架构:王昊相信视频生成负责未来预测、隐空间负责推理、3D 显式建模充当空间记忆,会拼出全新架构,这与大语言模型的历史路径相似。
  • 触觉模态:沈宇军笃定触觉会成为机器人不可或缺的新模态,并预计触觉一旦突破,物理世界与数字世界两侧的世界模型将分道扬镳。
  • 评测标尺:陶大程认为,最近的收敛不会发生在某一条技术路线上,而是会先发生在横向评测标尺上。他提到 ImageNet 让深度学习爆发,标尺一旦统一,收敛自然发生。

论坛期间,大晓机器人发布了 PHYSICAL IQ,定位为首个面向多场景、多本体、多任务的具身原生物理智能评测基准平台。

从 Demo 到 Deployment:差距不在上限而在下限

技术路线虽分歧明显,但嘉宾一致认同:落地的最终衡量标准是机器人能否在物理世界稳定完成任务。夏中谱称之为「决策有效性」,任广辉关注为 policy 提升多少指标,朱政强调多任务真机成功率。三者目标殊途同归。

Demo 稳定并不难,难的是规模化部署。王昊指出,模型能力从 90% 提升到 99%,再从 99% 提升到 99.9%,投入成本并非线性增长;实验环境里的微小错误率,落到现场便是一次次人工接管与返工。沈宇军则以商超场景为例,顾客随手把蔬菜放进牛奶柜,对每天面对不同顾客的机器人来说,这就是日常而非偶发。

陶大程重点强调了端侧能力对部署的关键性:留给机器人做判断的时间往往只有几十到几百毫秒,网络不能永远在线,云端也不能总在等待。最难的不是让模型变聪明,而是让聪明变得便宜、可靠、及时——「Demo 展示的是能力上限,部署则考验能力下限」。

两年后回看:什么做对了,什么做错了

最后,嘉宾被问及「如果两年后再看当下,什么做对了,什么做错了」:

  • 沈宇军认为,为模型架构能力做的工作都做对了,过度追求呈现效果则不好说;为数据链路做的准备方向正确,但当下积累的数据将来是否会被用到,尚不确定。
  • 朱政提醒,基模尚未收敛就去探索过多商业化场景,精力被严重分散,大概率不会成功。
  • 任广辉判断两年后世界模型会更加「具身原生」,需要更大规模具身原生数据与原生架构支撑。

陶大程在总结中表示:「分歧是论文的素材,重叠是产业的基底。」对整个行业来说,分歧本身正是当下的红利。

信源