桃子桃子快讯
返回首页
模型发布

Meta 发布 Muse Voice Transcribe:实时流式语音转写新模型

Meta Superintelligence Labs 推出 Muse Voice Transcribe,支持实时流式…

2026.09.02 · 周三2 分钟阅读

Meta 旗下超级智能实验室(Meta Superintelligence Labs,简称 MSL)正式推出语音领域新模型 Muse Voice Transcribe,主打实时流式音频感知能力。这是 MSL 首次对外发布实时音频感知模型,定位为面向语音转写场景的端到端方案。

核心能力

据 Meta 官方介绍,Muse Voice Transcribe 的关键特性包括:

  • 实时流式 ASR:支持低延迟的流式自动语音识别,可在语音输入过程中同步输出文本结果。
  • 说话人分离(diarization):可在包含 20 人以上的对话中区分不同说话人。
  • 端点检测(endpointing):自动判断说话起止,便于切分语句与触发下游逻辑。
  • 多语种与代码切换:覆盖 70 余种语言,支持同一段对话中多种语言无缝切换。
  • 上下文偏置(biasing):可通过语言、关键词与上下文提示提升专有名词和领域术语的识别准确率。

基准表现

Meta 表示,Muse Voice Transcribe 在第三方评测平台 Artificial Analysis 的流式语音转文字榜单上排名第一,同时在公开的说话人分离基准上也达到榜首位置。该成绩意味着其在延迟、准确率与多说话人场景的综合表现上,处于当前公开可比方案中的领先水平。

获取方式

Muse Voice Transcribe 即日起通过以下渠道开放使用:

  • Meta Model API:面向开发者的程序化调用入口。
  • Meta AI for Mac:macOS 客户端的内置能力。
  • Muse Code:Meta 提供的编码与开发环境。

行业意义

近年来,大模型厂商普遍将语音作为多模态战略的重要一环。Meta 此次以 MSL 名义推出专用语音模型,并强调流式、多说话人和代码切换等工程化能力,意在补齐其在实时交互、客服、会议转写等场景的底层基础设施。结合官方 SOTA 的表述,Muse Voice Transcribe 有望成为开发者构建语音 Agent 和会议工具时的备选底座之一。后续其在长音频、噪声鲁棒性以及与 Llama 系列多模态模型协同方面的表现,值得继续关注。

信源