研究论文
NVIDIA SANA 团队 Sol 引擎将 MiniMax H3 视频推理提速 27.7 倍
NVIDIA SANA 团队借助 Sol 引擎的低分辨率草稿 + 高分辨率精修方案,将 MiniMax H3 在单 GB…
2026.08.25 · 周二约 3 分钟阅读
NVIDIA SANA 团队最新发布的「Sol 引擎」在 MiniMax H3 视频生成模型上取得了显著的推理加速效果:单 GB200 上生成 10 秒 768p 视频的延迟从 414 秒压缩至 14.93 秒,相当于 27.7 倍提速。该方案通过「低分辨率草稿 + 高分辨率精修」的两阶段采样拓扑与硬件级注意力优化协同设计,将高保真 AI 视频从异步批渲染推向近实时交互基础设施的可行性边界。
技术方案:低分辨率草稿叠加高分辨率精修
Sol 引擎的核心思路是把一次视频生成拆成两段流水线:
- 第一阶段(4 步低分辨率草稿):在压缩后的潜空间里用 H3 模型快速产出低分辨率 draft,作为后续精修的内容锚点。
- 第二阶段(3 步 LTX 精修):在目标分辨率下用 LTX refinement pass 对草稿进行细节补全,并通过 Sol-Attn(Sol 注意力机制)控制计算量。
- 解码器替换:把传统沉重的 VAE 解码替换为更轻量的 TAEH3 / TAEHV,同时确保潜空间表征在跨阶段传递时保持稳定,从而避免精修阶段出现伪影或风格漂移。
该方案被视为「采样拓扑与硬件 kernel 加速协同设计」的典型案例:先压缩总步数,再针对 GPU 特性定制注意力路径,最后在解码器侧瘦身,整体实现端到端延迟的量级下降。
性能表现:414 秒到 14.93 秒
在 NVIDIA GB200 单卡环境下,针对 10 秒、768p 分辨率的视频生成任务,Sol 引擎交出了如下成绩单:
- 端到端延迟:414 秒 → 14.93 秒
- 加速比:约 27.7 倍
- 精修阶段步数:仅 3 步
- 草稿阶段步数:仅 4 步
值得注意的是,加速主要来自两阶段拆分和注意力优化两个杠杆,而非简单堆叠硬件资源。这意味着同样的硬件投入下吞吐可以提升近一个数量级。
经济性变化:单节点月产 37.8 万条
延迟量级下降后,AI 视频服务的单位经济随之发生根本性变化:
- 单 GB200 节点月产能约 378,000 条 视频
- 对应 GPU 毛利率声称可达 97% 以上
- 工作负载从「异步批处理渲染」转向可承载近实时、交互式请求的服务形态
按该口径换算,每条视频的边际计算成本已接近传统云端 GPU 推理服务的水平,而非过去的离线渲染预算。
行业意义:开源视频生态的一次工程示范
发布方将这次突破定位为「为开源权重生态设定新的工程标杆」。其潜在影响包括:
- 推动 AI 视频生成 从研究演示走向可商业化、交互式部署的基础设施。
- 提供一种可在多种开源视频模型上复用的「推理加速模板」,降低其他团队接入实时服务的门槛。
- 强化 NVIDIA 在生成式视频推理栈 的话语权,特别是在 open-weight 模型生态层面。
后续值得关注的具体细节包括:Sol 引擎是否随 MiniMax H3 权重一同开源、Sol-Attn 的实现是否依赖特定驱动版本,以及该方案在多卡节点、H100 等其他硬件上的可移植性表现。
