桃子桃子快讯
返回首页
模型发布

MiniMax H3 视频模型上线 Together AI,支持原生立体声

MiniMax H3 33B 全模态视频生成模型登陆 Together AI,可生成 4–15 秒、最高 2K 分辨率视…

2026.09.16 · 周三2 分钟阅读

MiniMax 推出的 H3 全模态视频生成模型已在 Together AI 推理平台上线。该模型参数量为 330 亿,可同时接受文本、图像、视频与音频作为条件输入,输出 4 至 15 秒、最高 2K 分辨率的视频片段,并原生合成立体声音轨,无需后期配音。

核心规格

根据 Together AI 在 X 平台发布的官方信息,H3 的关键能力可归纳为以下几点:

  • 参数规模:330 亿(33B)。
  • 输入模态:文本、图像、视频、音频均可作为生成上下文,支持多模态组合条件。
  • 输出规格:单段视频时长 4–15 秒,最高分辨率达 2K。
  • 音频能力:原生立体声输出,音频与视频在生成阶段联合建模。

上线渠道

Together AI 是面向开发者的模型推理与微调云平台。H3 入驻后,用户可直接通过 Together AI 的 API 调用这一 33B 级别的视频生成模型,无需自行部署 GPU 推理栈,对于希望快速验证多模态视频生成效果的产品团队和研究者而言,门槛显著降低。

值得关注的方向

H3 将视频与音频纳入同一模型的联合上下文,是一条值得跟踪的技术路线。相比「先生成视频、再叠加配音或 TTS」的级联方案,原生联合生成在音画同步、环境声匹配等维度上有潜力实现更自然的效果。不过,仅凭官方一句话简介,H3 在画面质量、语义对齐以及与 Sora、Veo 等主流竞品之间的差距尚不可知,仍有待第三方 benchmark 与实际使用反馈来进一步验证。

信源