桃子桃子快讯
←返回首页
产品功能

Qwen3-TTS 语音克隆上线 AWS SageMaker JumpStart

阿里通义 Qwen3-TTS-12Hz-1.7B-Base 模型已在 Amazon SageMaker JumpStar…

2026.09.26 · 周六约 3 分钟阅读

阿里通义千问团队开发的 Qwen3-TTS 系列文本转语音模型已在 Amazon SageMaker JumpStart 上线,开发者可通过托管实时推理端点进行部署,重点支持语音克隆与跨语言语音合成,可应用于多语种本地化、客服、有声读物与实时对话 AI 等场景。

模型版本与多语言能力

Qwen3-TTS-12Hz-1.7B-Base 是该系列的基础版本,参数规模为 17 亿,支持中文、英文、日文、韩文、德文、法文、俄文、葡萄牙文、西班牙文和意大利文共 10 种语言。该模型采用 Qwen3-TTS-Tokenizer-12Hz 语音分词器,支持流式生成,可满足低延迟交互场景。

Base 版本仅需数秒参考音频即可完成声音复刻,捕捉音色、音高、节奏等声学特征,并可作为后续微调的起点。这与 CustomVoice 版本形成互补——后者仅使用一组固定预设音色,无需用户提供参考音频。

语音克隆与跨语种迁移

借助语音克隆能力,应用可在不重新训练模型的前提下,从短录音中复刻指定说话人的声纹,用于合成新文本语音。该机制还支持跨语言克隆:参考音频属于某一语种时,可使用同一音色生成另一语种的语音,同时保留说话人身份特征。

主要适用场景包括:

  • 多语种内容本地化,保留原说话人音色
  • 客服与虚拟助手使用一致的品牌声音
  • 电子教学与有声读物呈现特定讲师或作者的声音
  • 创意原型阶段的对话与配音测试
  • 实时对话 AI 中的流式语音合成

SageMaker 部署方案

在 SageMaker JumpStart 中,Qwen3-TTS-12Hz-1.7B-Base 与 Qwen3-TTS-12Hz-1.7B-CustomVoice 以及 Qwen3-ASR-1.7B 一并提供。开发者通过 JumpStartModel 对象与 deploy 方法即可完成端点部署,无需编写自定义推理处理器,模型产物与预构建服务容器由 JumpStart 直接提供。运行容器使用 vLLM-Omni,输出 24 kHz 音频。

部署架构遵循 SageMaker 实时推理标准模式:

  • 客户端向端点发送 HTTP 请求,请求体包含目标文本、Base64 编码的参考音频及其转写文本
  • 请求被路由至 GPU 实例上的 vLLM-Omni 服务容器
  • talker 阶段由文本与参考音色生成语音 token,code2wav 阶段将其渲染为波形
  • 响应以 WAV 格式返回客户端

该部署方式的关键收益包括:按计算用量对齐成本(而非按字符 API 计费)、所有音频数据保留在自有 AWS 账户内、以及可在自有域内继续微调模型,无需管理底层 GPU 服务器。

配套 ASR 与运维监控

与 TTS 一并上线的 Qwen3-ASR-1.7B 语音识别模型,可与 TTS 组合构建端到端语音交互管道。运维侧可通过 Amazon CloudWatch 监控端点指标,以便根据实际负载调整资源配置,实现容量与成本的精细化匹配。

信源