桃子桃子快讯
返回首页
行业动态

WAIC 2026 业界激辩:世界模型距机器人「ChatGPT 时刻」还有多远

WAIC 2026 论坛上,具身智能头部企业围绕数据、模型路线、场景落地与评测标准展开讨论,多位负责人预测机器人「Cha…

2026.07.21 · 周二5 分钟阅读

在 2026 世界人工智能大会(WAIC)上,「具身智能部署元年」成为高频关键词。与以往展示机器人「舞蹈功底」不同,今年展会把真实产线搬上展台,行业目光从「能做什么」转向「能稳定地做成什么」。围绕「机器人『ChatGPT 时刻』还有多远」这一核心命题,多家具身智能头部企业在「智启具身论坛 2026」等分论坛与「世界模型六小龙」巅峰论坛上给出了不同解法与时间表。

数据:三道高墙与多元解法

智元合伙人、觅蜂科技董事长兼 CEO 姚卯青指出,世界模型的核心是「能够预测世界的下一步状态」,需要掌握多模态融合理解、物理规律认知与因果推理三项关键能力。但现实中,物理世界数据的信息密度远低于语言模型语料——「语言模型头部团队已经用到了 100 万亿 Tokens 的语料,约合 100 亿小时的人类说话时长,而具身智能所需的物理世界数据还差了万倍以上」。他将这一难题归纳为「数据墙」「表征墙」「闭环墙」三道必须翻越的障碍。

围绕数据来源,行业出现明显路线分歧:

  • Sunday Robotics 联合创始人赵子豪推荐低成本、无本体差异的 UMI(通用操作接口)数据采集方式,主张以「数量与效率」换取短期智能提升;
  • Physical Intelligence 研究科学家任至意则坚持真机数据不可替代,「只有真机采集的数据,才能在机器人上完整复现任务」;
  • Dyna Robotics 联合创始人马也骋提出「数据金字塔」方案,把互联网视频、第一人称数据、真机数据与部署回流数据分层处理,各司其职。

姚卯青总结道:「没有任何单一来源能解决物理 AI 的数据饥渴难题。」

模型:VLA 与 WAM 之争并未真正分出胜负

在模型路线选择上,「VLA(视觉-语言-动作模型)已死,WAM(世界动作模型)当立」的观点在网络上流传。但任至意回应:「到目前为止,没有看到哪家能做到比 π0.7 更亮眼的 demo,所以 VLA 还没有死。」同时承认,未来真正要做的是训练一个原生理解 context 的模型。马也骋则补充,Dyna 从 VLA 切换到 WAM 架构,是因为在餐巾折叠等高成功率、低数据效率的任务中 WAM 表现更优——这是被真实场景「逼出来」的中间路线。

腾讯首席科学家张正友从规模视角给出提示:「具身智能要达到 AGI 级别的智能,肯定不能只靠几百 B 的模型直接控制运动。」他提出认知系统、感知行动系统、底层反应系统三层架构,更接近完整的 Agent 系统。姚卯青则将两条路线收束为下一代模型 WRAM(世界推理动作大模型),并配套发布 GO-2 基座模型、Act2Goal 世界模型、GE-Sim2.0 等多款模型,搭配 Genie Evolver 百台级分布式真机强化学习体系。

部署:从实验室到产线与门店

工程层面,效率与可靠性同时被快速推进:

  • 智元搭建的 Genie Evolver 系统实现超过 100 台机器人同时在线策略迭代训练,模型权重可在 2 秒内下发到所有机器人,训练周期压缩到「分钟级」;
  • 大晓机器人发布的开悟世界模型 3.1 在端侧达到 125 毫秒的推理延迟,使「理解—推演—执行—反思」闭环可实时在本机完成;
  • 蚂蚁灵波则展示其在消费级显卡上 90–150 赫兹的推理效率。

真实场景验证方面,智元机器人在江西南昌的 3C 产线实现 99.99% 成功率并已稳定运行数月;Dyna Robotics 在马萨诸塞州一家餐厅完成超过 24 小时无人干预的餐巾折叠,850 个样本下成功率 99.4%;大晓机器人面向即时零售、酒店洗衣、巡检安防推出三套方案,计划未来一年完成 1000 家零售场景落地。无界动力 CT O 夏中谱分享的「隐空间世界模型 + 强化学习」双轮驱动方案,则强调在压缩空间内完成对未来状态的推演,再把推演转化为行动。

时间表与评测:行业呼唤统一标尺

关于机器人「ChatGPT 时刻」的预测,多位嘉宾给出了不同时间窗:

  • 姚卯青:最快两年;
  • 任至意、马也骋:四年左右;
  • 张正友:三至五年。

更普遍的行业共识是「缺一把尺子」。大晓机器人等企业在圆桌环节指出,当前世界模型评测仍停留在视频生成层面,与机器人真正需要的「物理因果推演能力」之间存在错位,正如自变量机器人 CT O 王浩所言,「今天的世界模型『可能 99% 的像素对决策毫无用处』,但行业花了大量算力去预测这些无用像素」。

针对这一痛点,论坛上亮相的 Physical IQ 物智是国内首个面向多场景、多本体、多任务的具身原生物理智能评测基准。该平台以统一协议贯通零售、工业、家居、物流等真实场景,重点考察双臂协作、移动与操作协同、长程任务规划、3D 空间推理、工具使用与多机协同等能力,吸引了智元机器人、辉羲智能、蚂蚁灵波等产业链上下游企业共同参与。

从论坛披露的数据与案例来看,物理 AI 不再只是「能跑 demo」的技术演示,而是进入可重复、可验证的部署阶段;下一阶段行业竞争的关键,正在从「能不能做出来」转向「能不能稳定地、大规模地做出来」。

信源