HelixWorld 1.0:实时音视频世界模型宣布开源
Noiz AI 联合港科、清华、CMU 等机构发布 HelixWorld 1.0,以原生 Transformer 联合生…
Noiz AI 联合香港科技大学、清华大学、卡内基梅隆大学、Google DeepMind 等机构的研究员,正式发布实时可交互音视频世界模型 HelixWorld 1.0。该模型以原生 Transformer 架构统一生成画面与声音,支持 24 FPS 实时画面与 48kHz 双声道音频同步输出,并将在未来几周内完全开源权重与代码。
这是世界模型方向首次在「可交互」维度上补齐声音短板,被视为继 Google DeepMind Genie 3、腾讯 WorldPlay、蚂蚁 LingBot-World 之后,又一类团队推动该方向。
核心能力:声画同源、动作驱动
传统视频生成模型产出的固定成品无法干预,而世界模型强调随用户操作实时渲染。HelixWorld 在此基础上进一步要求:声音和画面不是后期对齐,而是从一开始就在同一个世界里被生成。
关键特性包括:
- 24 FPS 实时画面生成;
- 48kHz 双声道音频同步输出;
- 原生 Transformer 架构联合建模,画面与声音共享表征并持续交换信息;
- 用户每次操作同时作用于两个模态,方向、距离、材质、遮挡变化会即时反映到声场中。
这意味着,用户往前走一步,前方场景延展生成,转身回望时声场也会随之旋转,而非仅有一条后期配上的音轨。
技术链路:从数据到实时
团队将方法拆为四步:
第一步:构建带空间和动作的音画数据
- 视觉侧沿用位姿估计反推相机轨迹以生成动作标签;
- 音频侧缺少现成数据集,团队自建清洗流程:去除伪立体声、与画面对不上的配乐、旁白与外加音效等;
- 真实施工:样本用于保真,游戏引擎样本用于精确的空间几何与声源位置;
- 逐帧校验声像位置与左右声道能量,过滤声画不对齐片段。
最终产出百万量级训练片段,并以此训练分类器筛选高质量微调子集。
第二步:画面与声场共同响应动作
以 LTX2.3 为基座,保留各自 latent 表征,但进入同一套 Transformer 联合生成。模型根据当前状态与用户动作,预测下一刻画面与声音。该阶段仍为双序列可见的双向模型,优先把动作控制与联合生成做准。
第三步:因果化与自生成历史训练
将双向模型改造为只允许查看过去的因果模型,借助 KV Cache 复用历史信息、逐块自回归生成。
关键挑战是训练与部署之间存在分布差异:训练时历史干净,部署时模型读的是自己刚生成的结果。团队引入「读自己生成的历史再预测正确结果」的训练策略,让模型提前适应误差累积。
第四步:实时化
主流少步方案如分布匹配蒸馏(DMD)易导致画面过曝。HelixWorld 将轨迹蒸馏与 DMD 并用,用前者稳住去噪路径、后者守住最终分布。结合因果化的 KV Cache 与逐块流水线,把生成从「一个片段」推到「持续运行」。
团队与开源计划
- 团队于 2025 年底组建,成员来自 Meta、Google、Dolby、清华等机构;
- 累计开源项目获超过 5 万 GitHub Stars;
- 创始人陈伟嘉(Vega)曾在 Meta 主导杨立昆团队 ASR 模型落地,公司 93% 以上代码开源;
- 首席科学家田泽越(Zeyue Tian)曾开源 AudioX、YuE 等工作,其中 ChatMusician 被杨立昆转发。
仓库地址:https://github.com/NoizAI/HelixWorld
Noiz AI 表示模型 API 已进入内测,并正在搭建一个面向创作者与用户的交互内容社区。
下一步:从实时音视频到多智能体与超长一致性
团队将「声画实时同步」视为第一步,后续重点包括:
- 多智能体:角色拥有身份、目标与记忆,剧情可自主发展;
- 多人现场:听清并区分谁在说话、声音从哪来、对话如何推进;
- 超长时间一致性:跑上数小时甚至更久,保持身份、记忆、空间状态与因果关系不漂移;
- 世界自主进化:无新 Prompt、用户离开,世界仍按自身规则延续运行。
当这些能力叠加在一起,游戏、互动影视、教育等场景的底层逻辑都将被改写。
