桃子桃子快讯
返回首页
模型发布

通义发布 Qwen-Audio-3.0-TTS,登顶第三方 TTS 榜单

通义 Qwen 推出 Qwen-Audio-3.0-TTS,分 Flash 与 Plus 两版,支持 16 种语言与细粒…

2026.07.23 · 周四2 分钟阅读

阿里通义 Qwen 团队正式推出 Qwen-Audio-3.0-TTS 文本转语音模型,并同步上线 API。该模型分为两个版本:Flash 面向实时交互场景,主打低延迟;Plus 面向高质量生成场景,强调音色表现与稳定性。

双版本定位

  • Flash:面向实时交互场景,主打低延迟,适合对话、直播、客服等需要即时响应的应用。
  • Plus:面向高质量生成场景,强调音色细节与稳定性,适合有声读物、视频配音、内容创作等离线或近线任务。

核心新特性

新版模型在控制粒度与生成能力上做了多项升级:

  • 细粒度内联标签:支持在文本中直接插入 [whisper][angry][breaths][laughs] 等标签,对局部语气、情绪与副语言现象进行精确控制。
  • 自由式自然语言控制:可用日常口语描述风格,例如「像睡前故事一样慢慢读」,由模型自行解析并执行。
  • 多语言覆盖:支持 16 种语言。
  • 抗噪参考音频:即便参考音频存在噪声,仍能输出干净的合成结果。
  • 长文本一次生成:单次最长支持约 3 分钟的长音频输出,无需切片拼接。

榜单与可用性

官方称 Qwen-Audio-3.0-TTS 在 Artificial Analysis TTS Leaderboard 排名第一,但未公布具体分数或对比模型细节。模型已在通义官方博客发布技术说明,并开放 API 接入,开发者可直接调用。

需要注意的是,「#1」成绩目前来自官方一手声明,尚未见独立第三方对其能力做完整复现评测;具体在中文方言、歌唱合成等长尾场景下的表现,仍有待后续实测验证。

信源