模型发布
通义千问发布 Qwen3.8-LiveTranslate 实时同传模型
通义千问推出基于 Interleave 架构的实时同传模型 Qwen3.8-LiveTranslate,支持 60 种语…
2026.09.19 · 周六约 2 分钟阅读
通义千问(Qwen)近日推出实时同声传译模型 Qwen3.8-LiveTranslate,主打低延迟与多语种场景。模型基于自研的 Interleave 架构构建,重点优化了翻译的忠实度、流畅度与简洁性,并在 60 种语言上将平均滞后(LAAL)从 2.8 秒降低至 2.3 秒。
核心架构与性能
Qwen3.8-LiveTranslate 采用 Interleave 架构,将语音识别、机器翻译与语音合成等多个模块进行交错式建模,从而在保持翻译质量的同时显著降低端到端延迟。官方表示,该架构在「延迟—质量」权衡上较前代方案有明确提升,2.3 秒的平均滞后接近人类同声传译的反应速度区间。
新增能力
- 实时说话人分离(Speaker Diarization):可在多人对话中区分不同说话人,并通过更稳定的音色克隆技术保留每位说话人的声纹。
- 同步双语显示:源语言与翻译结果在同一屏幕并排呈现,便于会议、直播等场景对照阅读。
- 长上下文消歧:利用对话历史信息,对人名、专有术语等进行上下文一致性消歧,避免同一术语在不同轮次出现不一致的译法。
落地与使用方式
Qwen 团队同步上线了官方博客与 QwenCloud 体验入口,用户可通过云端服务直接调用 Qwen3.8-LiveTranslate 的同传能力。博客中披露了更多技术细节与多语种评估数据。
从应用场景看,该模型面向国际会议、商务谈判、跨境直播、多语种客服等对实时性要求较高的场合;多人对话场景下的说话人分离与音色保留能力,使其区别于传统的单说话人翻译工具,具备更强的会议适配性。
小结
Qwen3.8-LiveTranslate 是通义千问在多模态与多语种方向上的进一步延伸,将实时翻译从「能用」推向「接近可用」的延迟区间。后续值得关注其开放程度、API 价格以及在长时段会议中的稳定性表现。
