桃子桃子快讯
返回首页
研究论文

端侧语音识别基准第二轮:苹果原生引擎紧追英伟达 Parakeet

研究者在同一台 M2 Pro Mac 上复测八款端侧英文 ASR 引擎,Parakeet TDT v2 以 2.01%…

2026.07.22 · 周三5 分钟阅读

近期一项在 Apple M2 Pro(32GB,运行 macOS 26.5.1)上完成的端侧英文语音识别基准第二轮测试显示,NVIDIA 推出的 Parakeet TDT v2 以 LibriSpeech test-clean 上 2.01% 的词错误率(WER)拿下榜首,但与 Apple SpeechAnalyzer 仅差 0.11 个百分点,与复旦大学 OpenMOSS 实验室的 MOSS-Transcribe-Diarize 也几乎并列。三款架构迥异的引擎同时挤进第一梯队,意味着消费级设备上的英文转写已进入"毫厘之争"阶段。

测试设置

第二轮在第一轮基础上新增三款引擎,所有引擎在完全一致的 5,559 条 LibriSpeech 音频(test-clean 2,620 条 + test-other 2,939 条)上运行,使用同一套评分脚本与归一化规则,原始转写文本可公开下载复现。本轮重点纳入读者点名要求的 Parakeet 系列,以及新近开源的 MOSS-Transcribe-Diarize。

主要结果

核心 WER 排名(数值越低越好):

  • Parakeet TDT v2(CoreML int8,约 443MB):test-clean 2.01%,test-other 3.40%
  • MOSS-Transcribe-Diarize(MLX,约 1.7GB):test-clean 2.07%,test-other 4.68%
  • Apple SpeechAnalyzer(macOS 26 系统组件):test-clean 2.12%,test-other 4.56%
  • Parakeet TDT v3 多语种版(CoreML int8,约 467MB):test-clean 2.51%,test-other 4.28%
  • Whisper Small(WhisperKit CoreML,约 460MB):test-clean 3.74%,test-other 7.95%
  • Whisper Base:test-clean 5.42%,test-other 12.51%
  • Whisper Tiny:test-clean 7.88%,test-other 17.04%
  • Apple SFSpeechRecognizer(旧版系统组件):test-clean 9.02%,test-other 16.25%

在干净语音上,三款领先引擎差距收敛到 0.11 个百分点,差距真正拉开的是嘈杂场景:Parakeet v2 在 test-other 上相对苹果引擎将错误率压低了约 25%。

Parakeet:冠军背后的量化代价

NVIDIA 官方公布的 Parakeet TDT v2 参考 GPU 实现数字为 1.69% / 3.19%,而本次基准实测的是应用真正能发布的形态——通过开源 FluidAudio 转换得到的 int8 量化 CoreML 版本,因此产生约 +0.3(干净)/ +0.2(噪声)的额外误差。这意味着"可发布的 Parakeet"相对苹果系统引擎的真实领先幅度大约只有官方宣称的三分之一。Parakeet v3 覆盖 25 种欧洲语言,以牺牲英文精度换取多语种能力,但在噪声场景仍略优于苹果引擎。

MOSS:另一种维度的竞争者

MOSS-Transcribe-Diarize 并非单纯的语音识别模型,而是一个 0.9B 参数的端到端音频语言模型,支持 50+ 语言、单次处理最长 90 分钟音频,并在一次前向中同时完成转写与说话人分离,输出直接带有 [S01]、[S02] 之类标签的时间戳文本。在一段 62 秒、由三位 LibriSpeech 说话人拼接而成的控制测试中,MOSS 词错误率 1.75%,且把全部 13 个分段都正确归属到对应说话人(即使说话人在 30 秒后再次出现也能正确识别)。这是一项轻量但严格的测试,覆盖了多数生产级说话人分离流水线最容易出错的部分;更严苛的多说话人会议基准(如带真实串扰的 AMI 数据集及其 DER 指标)将留到第三轮。

基准发现的 Bug:起始时刻被静音

MOSS 在 LibriSpeech 这类经过裁剪、语音从 t=0 即开始的音频上出现了诡异现象:在完整音频的处理中,有 182 条干净片段直接返回空转写,行为确定可复现。原因在于 MOSS 训练数据来自长音频,开头极少出现即时语音,因此它在部分片段上会立即吐出 end-of-output token。若在尾部追加静音,问题加重——额外 426 条片段彻底失声;在开头前置静音则全部恢复。第二轮基准最终统一采用了"每条片段前置 1 秒静音"的协议,并配置了 0.5s / 2s / 0s 的重试阶梯,使得 5,559 条样本中仅 7 条需要重试,最终零空输出。

对于计划集成 MOSS 的开发者而言,前置静音这一预处理步骤是将该模型从基准数字变成稳定可用组件的关键。

信源