桃子桃子快讯
返回首页
行业动态

WAIC 2026 三位具身大脑同台:世界模型该长什么样、卡在哪、先落哪里

智元姚卯青、它石智航陈亦伦、亮源新创姜旭在 WAIC 2026 圆桌论坛上讨论具身世界模型的核心能力、数据瓶颈与落地场景…

2026.07.20 · 周一4 分钟阅读

WAIC 2026 期间,具身智能毫无悬念地占据了展会绝对主角:展馆专设一整层,参展企业从 2025 年的 80 余家激增至 200 多家。在大会主论坛上,智元合伙人兼觅蜂科技 CEO 姚卯青、它石智航 CEO 陈亦伦、亮源新创 CEO 姜旭围绕「具身大脑」展开了一场高密度对话。三位嘉宾代表国内具身数据与算法头部团队,其中姜旭曾于 2024 年从 OpenAI 算法负责人岗位离职创业。整场讨论聚焦三个核心问题:世界模型应该长什么样、技术瓶颈在哪里、未来三年在哪里率先落地。

世界模型的核心能力:预测下一个状态与下一个动作

关于世界模型的定义,三位嘉宾给出了不同侧重的回答,但指向高度一致。

姚卯青从强化学习的本源出发,认为世界模型是理解物理世界运行规律的 AI 系统,其最关键的能力是「预测下一个状态」,而非简单渲染下一帧画面。他将其拆解为四项必备能力:

  • 多模态融合,理解现实世界各种类型信息的联合变化;
  • 掌握物理规律,包括动力学与空间关系;
  • 因果推理能力,理解「作用力导致物体移动」而非单纯模拟画面序列;
  • 长时间、长程推理能力,避免在长任务中崩坏。

陈亦伦则从机器人学角度定义:世界模型应当能高频联合预测 action(动作)与 state(状态)。相较 VLA 视觉-动作模型只给出下一步动作,世界模型还要回答「如果执行了这个动作,世界状态会怎样变化、变化是否符合预期」。在他看来,联合预测 action 和 state 的分布构成了强化学习三要素的更完备框架,将 action 分支单独取出即可退化为 VLA。

姜旭将世界模型任务拆为预测下一状态与预测下一动作两部分,并明确表态「预测下一个动作更重要」,因为训练世界模型的最终目的是控制机器人。他认为世界模型的突破路径应类比大语言模型,大规模模仿人、最终超越人。

核心瓶颈:真实物理交互数据仍严重不足

当被问及当前世界模型与理想形态的最大差距,三位嘉宾几乎一致指向数据。

姜旭指出当前主流架构难以同时兼顾「感知」与「生成」,因为两者需要完全不同的表征,因此难以用同一套优美架构统一。同时他认为仅靠世界模型无法实现通用具身智能。具身智能要迎来类似 ChatGPT 的爆发,仍需经历三次范式跃迁:可规模化的预训练、可规模化的对齐、可规模化的商业化与部署。

陈亦伦认为最核心的问题是缺乏可用于物理世界模型训练的大规模数据。视频对物理世界是「非完备性」数据,因为从视频中只能感受几何与语义,而无法获得力、接触、柔性等物理量。以自动驾驶为参照,纯视频训练工业级自动驾驶系统需要约 100 万小时数据,构建更复杂的物理规律模型则需 1000 万小时级别。

姚卯青补充道,现有世界模型多基于视频生成预训练 + 具身数据后训练,但互联网视频数据存在大量反物理规律内容,且现有物理引擎难以模拟柔性、流体、摩擦等真实接触。要达到像人一样判断物理常识的智能,需要亿小时级别的真实世界数据。

落地场景:工业先行,家庭仍需时日

关于未来三年的落地方向,三位嘉宾的判断高度趋同:先在高频、刚需、环境可控、容错空间大的工业制造场景跑通,再向更开放的家庭场景延伸。

姚卯青透露,智元上个月在产线做了连续 6 天真实计时直播,一个工段的机器人编队完成 6 万多件产线操作,整体成功率 99.99%,节拍接近人类。

陈亦伦对中国制造业的具身前景尤为乐观,理由有三:一是数据浓度高、任务完成判定标准明确;二是中国制造业在全球场景最集中、最丰富;三是其公司采用「Foundation AI + APP」技术路径,把汽车线束、流水线 1:1 搬到了展台,已与国内外汽车龙头合作推进千台级工业具身机器人集群部署。

姜旭则强调大模型落地的共同规律:先找高容错率场景,再逐步提升精度。早期 ChatGPT 容忍幻觉做「助手」,代码模型只做程序员提示,视频模型以「抽卡」方式使用——具身智能大概率也会沿类似路径,在高容错率场景率先爆发,再向精确可靠场景递进。

信源