NVIDIA Magpie 多语言 TTS 开放权重,新增阿拉伯语、韩语、巴西葡语
NVIDIA 发布 364M 参数的 Magpie 多语言 TTS 开放权重模型,支持 12 种语言,B200 单流首音…
NVIDIA 近日在 Hugging Face Blog 上推出 Magpie Multilingual TTS 的最新版本,以 364M 参数的开放权重模型覆盖 12 种语言,并在架构上引入「帧堆叠(frame stacking)+ 局部 Transformer」两项关键优化,目标是在企业自有基础设施上提供低延迟、可定制的语音合成能力。
多语言能力一次给齐
新版 Magpie TTS 支持的语言包括英语、西班牙语、法语、德语、意大利语、越南语、普通话、印地语、日语,以及本次新增的现代标准阿拉伯语、韩语和巴西葡萄牙语。每种语言都内置男女声,通过统一的 multilingual speaker representation 共享。
同时,模型对印地语和日语的 code-switching(中英文混说)支持做了扩展,借助 IPA 级别的 grapheme-to-phoneme 处理和可自定义的发音词典,使姓名、技术术语和多语种混排内容的合成更自然。开发者不再需要为不同区域维护单独的 TTS 模型,可以在一个开放底座上构建跨语种语音应用。
延迟:用户真正感受到的那一环
在对话式 AI 管线中,TTS 是用户听到响应的最后一步。Time to First Audio(TTFA),即从语音生成启动到首批音频到达用户的时间,是衡量语音体验是否「跟得上对话」的核心指标。
NVIDIA 给出了 Magpie 作为 NVIDIA TTS NIM 在不同 GPU 上的实测数据(v26.07,三次平均,本地部署):
- B200:单流 TTFA 32 ms,吞吐 12.1× 实时;64 并发 TTFA 239 ms,吞吐 319.81× 实时
- H100:单流 TTFA 47 ms,吞吐 14.7× 实时;64 并发 TTFA 275 ms,吞吐 290.79× 实时
- DGX Spark:单流 TTFA 53 ms,吞吐 9.8× 实时;64 并发 TTFA 962 ms,吞吐 75.88× 实时
- A100:单流 TTFA 79 ms,吞吐 12.2× 实时;64 并发 TTFA 395 ms,吞吐 197× 实时
B200 上 32 ms 的 TTFA 为同一管线中的 ASR 与 LLM 留出了充足预算,使端到端延迟有机会压在自然对话所需的 200 ms 窗口内。需要强调的是,开源 Hugging Face checkpoint 与 NIM 同一模型,区别在于 NIM 是面向生产的调优推理栈,前者面向研究与微调。
为何能做到这么快
低延迟并非偶然,而是两项互补的架构改进的结果:
- 帧堆叠(frame stacking):解码器在每一步预测两帧音频而非一帧,把解码迭代次数砍掉一半,缩短生成时间、提高吞吐。
- 局部 Transformer(local transformer):帧堆叠会因同时生成的 codebook token 之间产生依赖而损失音质,局部 Transformer 负责建模这些依赖并精修音频,把被牺牲的音质补回来。
两者结合,在不牺牲自然度的前提下换来了更短的首音频时间和更高的并发吞吐。
企业落地的几个关键点
对客服、医疗、企业 Copilot、翻译和对话式 AI 等场景,NVIDIA 把 Magpie 定位为「开源底座 + 自有基础设施」:
- 数据驻留:模型与音频数据都跑在企业自己的 GPU 上
- 可微调:开放权重支持领域定制,包括发音、人声风格
- 可观测:测到的延迟就是服务端真实延迟,不含托管服务往返
- 可扩展:根据工作负载在自有硬件上水平扩展
Magpie 并非要取代一体化语音 API,而是给需要在生产中掌控每一层延迟和数据流向的团队一个可调可控的开放选项。
