过去三年,大模型让人工智能学会了回答问题、生成图片与编写代码。然而,当 AI 真正走出屏幕,进入汽车、机器人、工厂与家庭时,仅仅「会说」远远不够。一个机器人可以复述如何把杯子放进橱柜,却可能因为无法判断杯子重量、柜门位置和机械臂运动轨迹而把杯子摔碎;一辆汽车可以识别前方车辆,却未必能够推演几秒后行人、非机动车与其他车辆之间的复杂互动。语言模型学习的是符号之间的关系,世界模型要学习的则是世界如何运行,行动会带来什么结果。
进入 2026 年,世界模型迅速成为中国 AI 产业最拥挤的新赛道之一。据行业不完全统计,国内相关企业已超过 30 家。腾讯、阿里、华为、百度等科技公司加快布局,蔚来等车企将世界模型装进量产汽车,极佳视界、流形空间、大晓机器人、星动纪元、拓元智慧、逆矩阵、LiberAI 等创业公司密集获得融资。继大语言模型和视频生成模型之后,中国 AI 公司开始争夺下一张船票,让机器不仅能够描述世界,还能理解世界、模拟世界,并在世界中行动。
四条技术路径通向物理世界
世界模型并非某种固定的模型架构,也没有统一的产业定义。它需要在内部建立一套关于外部环境的「数字表征」,理解空间结构、物体关系与基本物理规律,根据当前状态预测未来变化,并评估不同行动可能产生的结果。如果说大语言模型解决的是「下一个词是什么」,世界模型试图回答的则是「如果我这样做,接下来会发生什么」。
目前中国公司的探索大致沿着四条路径展开:
- 从视频生成走向可交互世界。 视频模型已能生成逼真的光影、人物和运动,但一段真实感强的视频并不等于模型真正理解了物理世界。这一方向需要在视频生成基础上增加空间一致性、长时记忆与动作响应能力。快手可灵、字节跳动 Seedance、生数科技 Vidu、Sand.ai 等公司积累的视频生成能力,正成为重要技术储备。
- 从 3D 生成与空间重建进入。 腾讯在 2025 年发布并开源混元 3D 世界模型 HunyuanWorld 1.0,可通过文字或图片生成可漫游、可编辑、可导出的 3D 空间,随后又推出支持原生 3D 重建和长距离漫游的 Voyager。群核科技、VAST 等公司在家装、建筑设计与 3D 内容生产方向积累了类似能力。
- 与世界模型与具身智能结合。 这是创业公司最集中的方向。机器人的核心瓶颈在于缺乏足够多、高质量的物理交互数据。世界模型相当于为机器人建立一座可无限复制的「虚拟训练场」,让机器人在模型生成的环境中反复尝试,再将策略迁移到真机。极佳视界围绕 GigaWorld 与 GigaBrain 进行全栈布局;流形空间推出 WorldScape 系列;大晓机器人将理解、生成、预测与决策放进统一架构;星动纪元提出世界动作模型;拓元智慧选择 Vision-World-Action 路线;LiberAI 则结合人类操作视频、UMI 采集数据与物理先验。智源研究院发布的 RoboBrain、RoboOS 等「悟界」系列平台也已开源。
- 从智能驾驶切入。 蔚来 2024 年发布 NIO WorldModel,2025 年首个版本开始向超过 40 万辆 Banyan 平台车型推送,覆盖主动安全、高速领航、城市领航和泊车等场景。百度 Apollo 的 ADFM、华为的世界动作模型以及多家车企的端到端驾驶模型,也在不同程度上加入对未来状态的预测和模拟。
商业化的四个优先场景
短期内,最先产生收入的并非「通用机器人」,而是那些能立即降低内容生产、数据采集与测试成本的工具。
- 游戏、影视与虚拟空间生产。 世界模型可根据文字、图片甚至一段视频生成完整空间,让创作者进入其中漫游、修改和重新布置。商业模式与当前生成式 AI 相似,包括模型 API 调用、云端算力收费、软件订阅与企业定制。
- 自动驾驶仿真与安全测试。 真实道路很难重复制造极端情况,世界模型可批量生成不同天气、道路和交通参与者组合下的长尾场景。市场更适合按软件平台、算力使用量、测试里程或项目授权收费。中国汽研等机构已将大规模合成数据、世界模型推演与长尾场景测试纳入自动驾驶仿真体系。
- 工业机器人、仓储与商业服务。 工厂和仓库的环境更加结构化,任务边界更加明确,更容易计算投资回报率。世界模型企业很可能先以「模型 + 机器人 + 场景解决方案」的方式进入工业客户,与机器人本体、传感器、工控系统深度结合。
- 家庭机器人。 家庭环境看似简单,实际上比工厂更复杂,每个家庭的户型、家具、物品与生活习惯都不相同。在可靠性和成本跨越临界点之前,市场仍将主要停留在高端产品、科研平台与特定功能设备。
跨越四道门槛才能真正落地
世界模型不能简单理解为「更高级的视频生成模型」。一段视频看起来越逼真,并不意味着它越懂物理规律。真正能够商业化的世界模型,至少要跨过四道门槛:
- 物理一致性。 模型不仅要生成杯子落地的画面,还要理解杯子为什么下落;不仅要复现汽车转弯,还要知道速度、道路曲率与轮胎状态之间的约束。
- 长时一致性。 当前模型可以在短时间内维持场景稳定,但任务一旦延长,物体位置、空间结构和因果关系就容易漂移,机器人整理房间或汽车穿越复杂城区都需要数分钟甚至更长时间的稳定记忆与预测。
- 实时性与成本。 如果模型推演一步需要几十秒,它可以制作视频,却无法控制高速行驶的汽车与持续运动的机械臂,必须在有限算力和功耗下实现低延迟推理。
- 真实世界的闭环验证。 衡量标准不应只是生成视频的美感或实验室榜单,而应是机器人任务成功率、自动驾驶接管率、仿真与现实的一致程度,以及部署后的安全性与经济性。
中国在这一轮竞争中拥有独特优势——庞大的制造业、智能汽车与机器人供应链,工厂、仓库、住宅、道路和商业服务等密集场景,以及来自传感器、机器与生产流程的真实物理数据。但场景并不会自动变成壁垒,只有能够进入客户现场,完成数据采集、模型训练、仿真验证、设备部署与反馈更新的公司,才能把产业资源转化为真正的数据飞轮。
未来,世界模型行业可能出现三类长期玩家:掌握通用基础模型与云计算平台的公司,向外输出 API 与开发工具;深耕汽车、机器人、工业等垂直领域的公司,通过行业模型与解决方案变现;掌握 3D 资产、物理数据、仿真评测或本体设备的公司,成为产业链中的基础设施提供者。相反,只拥有模型演示、缺乏真实数据与交付能力的公司,很可能在大语言模型让 AI 学会了谈论世界,世界模型则试图让 AI 真正进入世界。它未必会以独立 App 的形式出现在普通人面前,却可能隐藏在每一辆汽车、每一台机器人、每一座数字工厂与每一个虚拟空间背后。世界模型真正的商业价值,也不在于生成一个多么逼真的世界,而在于让机器在采取行动之前,先在内部「想象」一次未来。当这种想象足够准确、足够快速,也足够便宜时,人工智能才算真正迈出了屏幕。