桃子桃子快讯
返回首页
模型发布

智象未来发布原生全模态世界模型 HiDream-O1-World

在 WRC 2026 上,智象未来发布基于 UiT 架构的交互式世界模型 HiDream-O1-World,首次参评即登…

2026.08.24 · 周一3 分钟阅读

在 2026 年世界机器人大会(WRC 2026)期间举办的「物理 AI 引领者论坛」上,智象未来(HiDream.ai)创始人兼 CEO 梅涛发表主旨演讲,正式对外发布原生全模态交互式世界模型 HiDream-O1-World,并首次披露其自研 UiT(Unified Transformer)架构细节。该模型在首次参评的权威榜单 WBench 中即登顶 Navi 分榜。

从「高 IQ」到 Physical AI:世界模型成为认知中枢

梅涛在演讲中回顾了大模型过去几年的演进路径:大语言模型、多模态模型与具身智能三条原本独立发展的技术路线正在加速融合。他引用了一组数据——年初顶级大模型的 IQ 约为 130,到目前已接近 140——但同时强调「高 IQ 不代表全能」,能在考试中表现优异的模型,并不等于能在真实物理环境中长期、稳定地完成任务。

他将三条技术路线的核心能力概括为:

  • 大语言模型强在理解、压缩与推理;
  • 多模态模型强在生成与预测;
  • 具身交互模型强在与世界的交互。

梅涛认为,真正的世界模型需要同时具备对世界状态的完整表达、对物理规律和因果关系的推演,以及对世界的重构能力,这也是 Physical AI 的核心底座。

UiT 架构与 HiDream-O1-World 的核心能力

HiDream-O1-World 基于智象未来自研的 UiT 架构,支持文本、图像与交互式操控等多模态输入,主打三项核心能力:

  • 漫游:在生成世界中自由探索;
  • 编辑:对场景结构进行修改;
  • 交互:通过操控指令影响场景状态。

在风格化层面,模型既能高保真还原真实空间,也可生成二次元卡通、3A 游戏渲染等风格化场景。其底层突破点被概括为长时程的时空一致性与物理一致性:在长时序交互中「记住」已探索的场景结构,并在复杂交互中保持较高的物理合理性。

在应用方向上,智象未来给出的设想包括 AI 互动影游(用户成为叙事主动参与者)、具身智能仿真(搭建高保真虚拟训练底座)、3D 场景生成(缩短从创意到成品的迭代路径)等。

数据—模型—智能体—具身:构建闭环飞轮

梅涛将 Physical AI 的能力底座概括为「数据、模型、智能体、具身本体」的闭环:

  • 数据构建认知;
  • 世界模型负责理解世界状态、推演物理规律;
  • 智能体基于预测结果进行决策和规划;
  • 具身本体完成真实执行,真实环境反馈回流为新的训练数据。

在数据层面,智象未来表示已积累近千万小时时长的互联网视频先验数据。梅涛特别提到仿真数据在 Physical AI 中的价值——以与诺亦腾机器人的合作为例,利用原生全模态大模型对真实采集的人体动作数据进行增强处理,可在保持物理一致性的前提下生成同一动作在不同背景、场景、肤色下的视频,从而降低真实数据采集成本。

围绕此次发布,智象未来表示将以 HiDream-O1-World 为起点,逐步完善覆盖图像模型、视频模型与交互式世界模型的模型矩阵,推动 Physical AI 从技术探索迈入规模化应用阶段。

信源