桃子桃子快讯
返回首页
模型发布

几何-外观解耦:世界模型的第三条技术路线突围

智象未来发布交互式世界模型HiDream-O1-World,登顶WBench Navi榜单,在时空与物理一致性上取得突破…

2026.08.18 · 周二6 分钟阅读

近日,在交互式视频世界模型评测基准 WBench 榜单的核心 Navi 分榜中,一款名为 HiDream-O1-World 的模型以平均分 80.9 的成绩登顶,模型来自国内团队智象未来。这一成绩将世界模型这一正在升温的赛道再次推至台前。

世界模型赛道升温,三条路线并行

2026 年被不少从业者视为「世界模型元年」。海外方面,Yann LeCun 离开 Meta 后创办 AMI Labs,聚焦世界模型方向,已拿下超 10 亿美元融资;Google DeepMind 此前预发布的通用世界模型 Genie 3 于 1 月 30 日向用户开放 Project Genie,支持用文字或图片生成可交互的 3D 虚拟世界;李飞飞创立的 World Labs 完成超 10 亿美元融资、估值超 50 亿美元,其 3D 世界生成产品 Marble 已上线。

国内方面同样动作密集:4 月 16 日,腾讯发布开源的混元 3D 世界模型 2.0(HY-World 2.0),阿里推出主打实时交互的 HappyOyster;一周后,字节发布新一代 3D 生成大模型 Seed3D 2.0。《中国"世界模型"创业公司研究报告》显示,仅截至 2026 年 6 月底,国内以世界模型为核心标签的创业公司已超过 30 家,涵盖 6 条技术路线。

目前行业公认的两大主流技术流派分别由 Google 和 World Labs 代表:前者聚焦实时交互式世界建模,强项在于生成式响应,但在多模态统一表达与音视频联合生成上仍有挑战;后者走 3D 空间结构化重建路线,从三维几何出发追求结构精确与可编辑,静态场景保真度优势明显,但长时序动态生成与物理交互仍处于早期。两条路线各有侧重,而 HiDream-O1-World 的出现,则代表了一种不同的解题思路。

两道行业难题:时空一致性与物理一致性

交互式世界模型长期面临两个核心挑战。其一是时空一致性:当视角移动、场景漫游后,物体位置、结构与遮挡关系容易错乱,画面"越玩越崩"。WBench 对 20 余个交互式模型的"CT 式"扫描发现,连续交互后所有模型的导航能力平均分下降约 33 点,位姿误差逐轮累积,是迭代式生成范式的结构性缺陷。

其二是物理一致性:当前许多模型本质仍在拟合像素分布而非物理规律,画面再精致,物体悬浮、穿墙、碰撞反馈失真等问题仍会让用户"出戏"。WBench 评测中,物理维度是所有模型得分最低的维度之一。

在 HiDream-O1-World 的成绩单上,时空一致性维度 88.0 分位居前列,物理维度 73.3 分排名第一。其中,视觉合理性较行业平均提升 13.6%,因果保真度(流体、碰撞、形变等综合衡量)提升 12.7%。从展示效果看,模型在第一人称或第三人称视角下可自由漫游,并支持对画面进行实时编辑,覆盖从写实城市街景到二次元幻想世界等多种风格;但展示视频也表明,长序列极端场景下的稳定性仍有提升空间。

技术底色:原生全模态 UiT 与几何-外观解耦

HiDream-O1-World 的突破被归因于两层设计。

第一层是原生全模态 UiT(Unified Transformer)架构。传统多模态模型多走"拼积木"路线,文本、图像、扩散生成各模块独立工作。HiDream 自研的 UiT 则将图像像素、文本 Token、视频体素、空间关系等信号映射到同一共享 Token 空间,由同一套 Transformer 直接处理,使"理解"与"生成"在底层即统一。

第二层是几何-外观解耦的两阶段生成范式。当前主流的 3D 交互生成模型大多依赖隐式时空表征,一步到位地拟合像素分布生成视频,几何与外观深度耦合,难以保证跨视角一致性,也不理解物理规律。HiDream-O1-World 将生成拆为两阶段:第一阶段先由预训练的 3D 基础模型提取多尺度几何特征,并压缩至适合视频扩散模型的表示空间,作为显式结构条件;第二阶段由视频扩散模型在该结构条件下完成去噪与解码。几何阶段主攻结构完整与交叉视图一致性,外观阶段聚焦纹理细节与高保真渲染。

此外,模型在推理阶段引入 Test-Time Training 推理在线自适应机制,针对未知场景动态适配几何约束,进一步强化长时序交互下的 3D 几何一致性,并为物理一致性提供底层支撑——具备明确位置、体积与遮挡关系的物体,其运动天然要遵循重力、碰撞等规律。

据悉,HiDream-O1-World 聚焦空间一致性研究的相关论文已入选 ECCV 2026,为交互式世界模型在三维空间理解与长时序生成方向提供了兼具理论原创性与工程可行性的路径参考。

通往 AGI 的下一程

世界模型之所以被寄予厚望,源于两条逻辑:一是 Scaling Law 在大语言模型上已显现边际收益递减与数据枯竭迹象,业界需要新的训练范式;二是世界模型本身具备广阔的应用外延——游戏可跳过传统 3D 引擎流水线,影视可用文字与图像"拍摄"复杂场景,具身智能需要可推演的仿真环境,VR/AR 也不再完全依赖人工建模。从互动影游、3D 场景生产到具身智能仿真与微观世界推演,每一个"构建一个世界"的场景,都可能被重写。

路线分歧尚未收敛,但恰恰意味着终局未定。HiDream-O1-World 以几何-外观解耦给出的第三种答案,能否在大厂与初创公司的多线竞争中持续兑现,仍有待更长时间与更多场景的检验。

信源