模型发布
Meta 发布 Muse Voice Transcribe:实时流式语音转写新模型
Meta Superintelligence Labs 推出 Muse Voice Transcribe,支持实时流式…
2026.09.02 · 周三约 2 分钟阅读
Meta 旗下超级智能实验室(Meta Superintelligence Labs,简称 MSL)正式推出语音领域新模型 Muse Voice Transcribe,主打实时流式音频感知能力。这是 MSL 首次对外发布实时音频感知模型,定位为面向语音转写场景的端到端方案。
核心能力
据 Meta 官方介绍,Muse Voice Transcribe 的关键特性包括:
- 实时流式 ASR:支持低延迟的流式自动语音识别,可在语音输入过程中同步输出文本结果。
- 说话人分离(diarization):可在包含 20 人以上的对话中区分不同说话人。
- 端点检测(endpointing):自动判断说话起止,便于切分语句与触发下游逻辑。
- 多语种与代码切换:覆盖 70 余种语言,支持同一段对话中多种语言无缝切换。
- 上下文偏置(biasing):可通过语言、关键词与上下文提示提升专有名词和领域术语的识别准确率。
基准表现
Meta 表示,Muse Voice Transcribe 在第三方评测平台 Artificial Analysis 的流式语音转文字榜单上排名第一,同时在公开的说话人分离基准上也达到榜首位置。该成绩意味着其在延迟、准确率与多说话人场景的综合表现上,处于当前公开可比方案中的领先水平。
获取方式
Muse Voice Transcribe 即日起通过以下渠道开放使用:
- Meta Model API:面向开发者的程序化调用入口。
- Meta AI for Mac:macOS 客户端的内置能力。
- Muse Code:Meta 提供的编码与开发环境。
行业意义
近年来,大模型厂商普遍将语音作为多模态战略的重要一环。Meta 此次以 MSL 名义推出专用语音模型,并强调流式、多说话人和代码切换等工程化能力,意在补齐其在实时交互、客服、会议转写等场景的底层基础设施。结合官方 SOTA 的表述,Muse Voice Transcribe 有望成为开发者构建语音 Agent 和会议工具时的备选底座之一。后续其在长音频、噪声鲁棒性以及与 Llama 系列多模态模型协同方面的表现,值得继续关注。
