桃子桃子快讯
返回首页
模型发布

阿里Qwen-Audio-3.0-TTS发布,登顶全球TTS权威榜单

阿里推出语音合成模型Qwen-Audio-3.0-TTS,支持16种语言与20种方言,在Artificial Analy…

2026.07.20 · 周一2 分钟阅读

阿里通义团队于 7 月 20 日发布语音合成大模型 Qwen-Audio-3.0-TTS,在细粒度标签控制、自由风格指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面进行了系统性升级,并在全球第三方权威榜单 Artificial Analysis 上由 Plus 版本斩获冠军。该模型包含两个版本:面向实时交互的 Flash 版本(首包延时 300ms 级别)与面向高质量生成的 Plus 版本。目前两款模型已在阿里云百炼平台开放调用。

细粒度标签与风格控制

Qwen-Audio-3.0-TTS 的上一代已支持 freestyle 自由风格模式,可在提示词中设定「资深客服」「足球解说员」等角色,以控制情绪、场景和语速。新版本在此基础上引入结构化标签机制,允许用户直接在文本里嵌入 [gasp](抽一口气)、[giggles](轻笑)、[angry](愤怒)等标记,将控制精度从整段情绪细化到具体某个字之后的声学表现,适用于叙事、游戏、有声内容配音等需要精确把控细节的场景。

多语种与多方言覆盖

面向全球多语种场景,模型在中、英、日、韩、德等 16 种语言基础上,新增阿拉伯语、越南语、马来语和菲律宾语。根据 CV3-Eval 多语种基准测试:

  • 在 16 种语言的「词/字错误率」评测中,Qwen-Audio-3.0-TTS 家族在 10 种语言上取得 SOTA,韩语与马来语领先幅度最大。
  • 在 16 种语言的「说话人相似度」评测中,Plus 版本包揽全部最优,Flash 版本取得 15 项第二,马来语、西班牙语、阿拉伯语领先幅度最为明显。

针对大模型训练中方言易滑向普通话腔调的痛点,研究团队设计了方言强化训练方案,覆盖广东、重庆、东北、陕西、上海、四川、云南等 20 种方言,使其在韵律、声调与口语表达上更贴近母语者。

抗噪克隆与高保真输出

传统语音克隆通常要求原始参考音频在安静环境下录制。Qwen-Audio-3.0-TTS 通过真实声学仿真训练,在克隆流程中嵌入语音增强能力,使模型在高噪声、高混响条件下也能过滤干扰、保留音色。同时,模型内置开箱即用的精品音色库,音频输出采样率从 24kHz 提升到 48kHz,达到录音棚与影视配音规格,单次语音合成最长支持 3 分钟。

信源