模型发布
通义发布 Qwen-Audio-3.1:五款音频模型组成全栈,API 大幅降价
通义千问推出 Qwen-Audio-3.1 音频全栈,五款模型覆盖理解、生成、交互与创作,ASR、Realtime AP…
2026.09.23 · 周三约 2 分钟阅读
通义千问(Qwen)于官方 X 平台正式推出 Qwen-Audio-3.1 音频模型系列,包含 ASR、TTS 与 Realtime 三条主线以及两款新模型 TTS-Next、ASR-Next,共五款模型构成完整音频栈,覆盖理解、生成、交互与创作四大场景。同时官方宣布全线 API 大幅降价:TTS 降价约 70%,Realtime 降价约 85%,ASR 最高降价 95%。
模型矩阵与核心升级
此次 Qwen-Audio-3.1 形成「3+2」五模型结构:
- ASR(语音识别):多语言与方言识别能力增强,并新增「原生润色」功能,可自动去除口语中的填充词与重复,输出更逻辑清晰的转写文本。
- ASR-Next(新增):支持多人对话场景的多说话人识别,提供说话人标签、时间戳及对齐转写,并能识别情绪、环境音与机器声,可用于声音描述、事件定位、音频问答与推理。
- TTS(语音合成):支持多语言与方言合成,具备跨语种音色迁移能力,可通过自然语言指令控制情绪、语速与风格。
- TTS-Next(新增):采用统一语言模型 + 扩散模型框架,一次性输出语音、音效与背景音,适用于有声书、播客、游戏音效与广告音频。
- Realtime(实时对话):支持真正的边说边听与随时打断,模型可在感知到用户低情绪时自动放慢语速并给出共情回应。
价格策略与产业影响
本次降价幅度在语音类 API 中极为激进,ASR 与 Realtime 下调七至九成,直接拉低语音交互产品的接入成本,对依赖 ASR/TTS 的客服、教育、播客与有声内容开发团队影响尤为显著。
接入方式
Qwen-Audio-3.1-ASR 与 Qwen-Audio-3.1-Realtime 已开放 API(链接见官方 X 帖子),完整技术细节可参考通义官方博客。TTS-Next 与 ASR-Next 的更多 API 接入信息官方表示「即将上线」。
