世界模型接棒 VLA:具身智能的「大洗牌」前夜
机器人行业焦点从本体转向大脑,世界模型路线持续升温,但定义分歧、路线之争与商业化 ROI 压力仍未消散。
进入 2026 年,机器人行业的焦点正在从本体转向「大脑」,世界模型随之迅速升温。光象实验室首席科学家吕尧近日在接受界面新闻等媒体采访时表示,评价一个世界模型不能只看下一帧像不像,还要看动作一变时模型能否正确解释世界为什么跟着变。在他看来,只有学到物理世界底层的因果规律,才谈得上通用具身智能。
两条技术路线:VLA 与世界模型之争
具身智能领域关于「大脑」的讨论,主要围绕 VLA 和世界模型两类技术思路展开。二者并非严格互斥,但关注重点有所不同:
- VLA(Vision-Language-Action,即视觉-语言-动作模型):将视觉、语言等输入与机器人动作连接起来,典型模型通过机器人示范数据学习如何根据观测与指令生成动作。
- 世界模型(World Model):无论是 Sora 一类的生成式模型、World Labs 一类的空间智能模型,还是以 JEPA 为代表的视觉表征模型,本质上都遵循同一建模范式,即通过海量数据学习世界的统计表征,从观测中预测未来变化。
对路线的争论并非今年才出现。在 2025 世界机器人大会上,宇树科技创始人王兴兴就曾公开对当时热门的 VLA 路线提出质疑,认为人形机器人大规模应用当前最大的卡点在 AI 模型,并将 VLA 称为「相对比较傻瓜式的架构」,更看好通过视频生成或世界模型驱动机器人。一年过去,世界模型明显升温,但技术路线并未因此收敛。
世界模型仍未形成统一定义
吕尧认为 VLA 已经触碰到天花板,前端是语言模型、后端接动作专家头,语言 token 映射到动作空间存在模态鸿沟,仅靠超大规模数据训练 VLA 生成真正泛化的通用策略基本不现实。行业已开始重新审视原有路线,但共识也基本到此为止。
「世界模型」至今仍缺乏统一定义,这一点最直观的表现是大家讲的可能根本不是同一种东西。李飞飞与 World Labs 团队今年专门撰文,将世界模型按功能分为三类:
- 渲染器(renderers):主要生成给人看的像素画面;
- 模拟器(simulators):要求对几何、物理与动态变化有更准确的描述;
- 规划器(planners):负责根据观测和目标决定下一步动作。
World Labs 也将 VLA 归入规划器一类,这意味着 VLA 与世界模型本身就未必是非此即彼的关系。智平方创始人兼 CEO 郭彦东在今年 6 月的北京智源大会上同样表示,世界模型不是 VLA 的竞争路线,而是 VLA 体系中的核心组成部分。
分歧不只在定义。一位从事世界模型业务的公司负责人对界面新闻记者表示,部分视频生成结果乍看效果不错,但对摩擦力等物理属性的表达仍然不足,真正用于机器人操作执行时并不够用,相关数据目前仍需企业自行采集,成本不低。该负责人还指出,行业目前连机器人能力如何分级都尚未形成统一标准。现阶段机器人已能在工厂里完成一些边界明确、流程较短的工序,但若换成家庭打扫卫生这类开放任务,距离真正完成仍有较大差距。
光象科技与 Phi-WM 1.0 ActEffect:从「动作会怎样改变世界」切入
光象选择从「动作会怎样改变世界」这一问题切入。近日,光象科技联合清华大学李升波教授课题组发布第一代物理原生世界模型 Phi-WM 1.0 ActEffect,核心在于将世界模型转变为「训练时反馈器」,让机器人学会「动作会带来什么后果」。具体而言,ActEffect 能一次性生成三种精细程度不同的动作方案,分别预测每个方案可能带来的结果,通过比较筛选出最优方案。训练完成后世界模型被移出推理链路,部署时由策略网络一次前向计算直接输出动作。按吕尧的解释,相当于把世界模型对动作后果的判断提前「蒸馏」进策略权重,以降低部署阶段的推理负担。
在数据问题上,吕尧并不认同纯视频预测型世界模型能够天然降低数据需求:训练一个足够保真、具备泛化能力的视频预测模型本身仍需海量数据。但若世界模型能从数据中提炼出跨场景通用的底层物理规律,则可能降低对跨场景、跨本体数据的需求。光象科技创始人兼 CEO 张涛举例称,往筐里扔十个不同重量与形状的东西,练十次都能扔进去,换上没见过的物体仍需重新试。按这套逻辑,最稀缺的不是成功示范,而是在仿真里大量试错、做反事实推理的数据。吕尧判断,所需的反事实试错数据可能是真实成功示范的 10 倍甚至 100 倍;而到了具体工位进行真机后训练时,数据量约从十几个小时到几十个小时,最多不超过 100 小时。
资本涌入与商业化 ROI 压力
虽然技术路线尚未收敛,并没有妨碍资金快速涌入。CB Insights 数据显示,世界模型相关投资额从 2024 年的 14 亿美元增至 2025 年的 69 亿美元,接近增长至原来的 5 倍。进入 2026 年大额融资仍在继续:2 月,李飞飞创办的 World Labs 宣布完成 10 亿美元新融资;3 月,Yann LeCun 参与创办的 AMI Labs 完成 10.3 亿美元融资。World Labs 聚焦空间智能与世界模型,AMI Labs 则把对真实世界的建模、推理与规划作为核心方向。
但工厂不会只看模型需要多少数据。IDC 今年 8 月发布的研究显示,2025 年中国工业具身智能机器人市场规模约 57.4 亿元,用户调研显示超过 80% 的制造企业希望项目能够在两年内实现投资回收。对工业客户而言,VLA 还是世界模型并不那么重要,能不能快速部署、稳定运行,并在预期时间内回本才是关键。
「(具身智能)行业很可能像当年的自动驾驶一样,经历一次大洗牌,」吕尧向界面新闻等媒体作出判断,资本市场最终会回归理性,缺乏核心技术护城河与真实交付能力的企业将率先出局。张涛认为,如果行业维持目前的状态,一到两年内确实可能迎来寒冬,结果并非已经注定。在他看来,真正的变量,是能不能在此之前出现第一个被市场验证、具备规模化潜力、并能够创造真实商业价值的具身智能应用。资本已经提前下注,但机器人真正进入现实场景的速度还没这么快。
