行业动态
MiniMax H3 推理再提速:SGL+VDN-H3 在 8 卡 B200 上实现超 2× 实时去噪
MiniMax 官方宣布,SGL 项目结合 VDN-H3 方案,使 H3 在 8 张 B200 上实现超 2× 实时去噪…
2026.09.15 · 周二约 2 分钟阅读
MiniMax 近日在 X 平台宣布,其 H3 视频生成模型在社区推理方案 SGL Project 与 VDN-H3 的组合优化下,推理速度再获突破。在 8 张 NVIDIA B200 GPU 的硬件配置下,H3 已可实现超过 2× 实时去噪,端到端 9.0 秒即可生成 14.4 秒 768p 分辨率视频(热身后数据),且官方称未观测到质量回退。
关键性能数据
- 硬件配置:8× NVIDIA B200
- 输出规格:768p 视频,时长 14.4 秒
- 端到端生成耗时:9.0 秒(warmup 之后)
- 去噪速度:超过 2× 实时
- 质量表现:官方称「无测量到的质量回退」
背后的技术组合
此次提速并非 H3 模型本身的权重更新,而是通过推理侧方案实现的:
- SGL Project:开源的 LLM/扩散模型推理引擎与运行时,由社区维护,已被广泛用于扩散模型的推理加速;
- VDN-H3:针对 H3 模型的变分去噪或蒸馏加速方案,与 SGL 结合后形成完整的推理优化栈。
「开源模型在开源生态中复利」
MiniMax 在帖文最后写道:「Open models compound through open ecosystems.」这一表述点明了此次提速的核心逻辑——H3 作为开放权重模型,其推理速度的提升不再完全依赖模型提供方,而是由开源社区通过推理引擎、蒸馏方案、调度优化等手段持续叠加。这意味着开发者部署 H3 时,可借助 SGL 等开源工具链获得更优的吞吐量与时延表现。
意义与局限
对于正在评估视频生成模型推理成本的研究者与工程团队而言,9.0 秒生成 14.4 秒 768p 视频是一个可参照的实际性能锚点。需要注意的是,该数据基于特定硬件(8× B200)与 warmup 之后的状态,实际冷启动及不同 batch、不同 prompt 复杂度下的表现尚未在官方公告中披露;「无质量回退」的具体衡量标准与对比基线也有待官方后续补充更详细的技术说明。
