模型发布
通义发布 Qwen-Audio-3.0-ASR-Flash,面向专业术语场景
阿里通义千问推出 Qwen-Audio-3.0-ASR-Flash 语音识别模型,主打上下文一致性与领域术语识别,医疗、…
2026.07.31 · 周五约 2 分钟阅读
阿里通义千问近日通过官方 X 账号发布 Qwen-Audio-3.0-ASR-Flash 系列自动语音识别(ASR)模型,针对上下文一致性与领域术语识别能力进行了重点升级,并一次性放出三种部署形态,方便不同场景接入。
模型版本与定位
本次更新包含三个子版本,分别面向不同业务需求:
- Qwen-Audio-3.0-ASR-Flash:标准版本,提供完整能力;
- Qwen-Audio-3.0-ASR-Flash-Streaming:流式版本,适合实时语音转写与会议场景;
- Qwen-Audio-3.0-ASR-Flash-Filetrans:文件转写版本,适合长音频离线批处理。
官方在博文中重点强调「更多上下文感知、更强的领域术语识别」,目标用户是医疗、工业、法律等对专业词汇识别精度要求较高的行业客户。
核心能力
Qwen-Audio-3.0-ASR-Flash 在功能层面带来四项升级:
- 上下文一致性:在多轮对话或长音频中保持术语与人称指代稳定;
- 领域术语识别:针对专业词表优化识别准确率;
- 自定义热词:支持用户上传自定义词表,提升专有名词命中率;
- 语音润色:将口语化转写整理为结构化文本,便于后续处理与归档。
内部基准表现
官方披露的内部测试数据显示,Qwen-Audio-3.0-ASR-Flash 在专业术语召回上表现突出:
- 医学术语召回率:95.36%;
- 工业术语召回率:93.24%。
两项指标均刷新了通义此前 ASR 模型在该类评测中的表现。官方未在博文中同步发布与 Whisper、商用 ASR 服务等竞品的横向对比,相关能力的实际差距仍需外部独立评测验证。
可用性与说明
三个模型变体均已在通义千问官方渠道开放,用户可前往通义开放平台或模型仓库获取 API 与权重链接。考虑到 ASR 在客服、会议、字幕生成、医疗病历录入等场景的广泛需求,本次更新对面向 B 端的专业语音解决方案厂商具有一定参考价值。
