模型发布
通义发布 Qwen-Audio-3.0-TTS,登顶第三方 TTS 榜单
通义 Qwen 推出 Qwen-Audio-3.0-TTS,分 Flash 与 Plus 两版,支持 16 种语言与细粒…
2026.07.23 · 周四约 2 分钟阅读
阿里通义 Qwen 团队正式推出 Qwen-Audio-3.0-TTS 文本转语音模型,并同步上线 API。该模型分为两个版本:Flash 面向实时交互场景,主打低延迟;Plus 面向高质量生成场景,强调音色表现与稳定性。
双版本定位
- Flash:面向实时交互场景,主打低延迟,适合对话、直播、客服等需要即时响应的应用。
- Plus:面向高质量生成场景,强调音色细节与稳定性,适合有声读物、视频配音、内容创作等离线或近线任务。
核心新特性
新版模型在控制粒度与生成能力上做了多项升级:
- 细粒度内联标签:支持在文本中直接插入
[whisper]、[angry]、[breaths]、[laughs]等标签,对局部语气、情绪与副语言现象进行精确控制。 - 自由式自然语言控制:可用日常口语描述风格,例如「像睡前故事一样慢慢读」,由模型自行解析并执行。
- 多语言覆盖:支持 16 种语言。
- 抗噪参考音频:即便参考音频存在噪声,仍能输出干净的合成结果。
- 长文本一次生成:单次最长支持约 3 分钟的长音频输出,无需切片拼接。
榜单与可用性
官方称 Qwen-Audio-3.0-TTS 在 Artificial Analysis TTS Leaderboard 排名第一,但未公布具体分数或对比模型细节。模型已在通义官方博客发布技术说明,并开放 API 接入,开发者可直接调用。
需要注意的是,「#1」成绩目前来自官方一手声明,尚未见独立第三方对其能力做完整复现评测;具体在中文方言、歌唱合成等长尾场景下的表现,仍有待后续实测验证。
