桃子桃子快讯
←返回首页
研究论文

临床对话 diarization 模型横评:Pyannote Precision-3 误差最低,Nemotron 3 速度领先

作者在 15 段模拟医患对话上对比了 Pyannote、Nemotron 3、Sortformer、VibeVoice…

2026.09.26 · 周六约 4 分钟阅读

来自 Omi 团队的开发者近日在 Reddit 上发布了一项说话人 diarization(说话人归属)模型对比测试,在 15 段模拟医患对话(来自公开数据集 PriMock57,共约 2.4 小时)上系统比较了 Pyannote、Nemotron 3、Sortformer、VibeVoice-ASR 和 Meta Muse Voice Transcribe 等模型的表现。测试统一采用自动判定说话人数(不预先告知模型对话双方为两人),边界容忍度设为 ±250 ms,并以 Diarization Error Rate(DER)为主要指标,数值越低代表效果越好。

离线批处理结果

Pyannote Precision-3 以 2.891% 的 DER 取得最低误差,但平均每段录音处理时间约 18.9 秒。NVIDIA 的 Nemotron 3 紧随其后,DER 为 4.803%,且在单张 NVIDIA L4 GPU 上每段录音仅需 0.688 秒,是所有本地模型中最快的。

其余模型的表现如下:

  • Pyannote Community-1:DER 6.620%,处理时间 18.691 秒/段
  • Sortformer v1:DER 6.778%,处理时间 3.869 秒/段
  • Sortformer v2.1:DER 7.974%,处理时间 1.077 秒/段
  • VibeVoice-ASR:DER 8.233%,处理时间 123 秒/段(同时执行转写)
  • Meta Muse Voice Transcribe:DER 13.042%,处理时间 92 秒/请求(受 10 分钟单次请求限制,被拆分为 20 个片段分别处理,结果不构成完整录音级对比)

API 调用时间包含网络往返开销。

流式场景表现

在流式推理测试中,Pyannote 实时 API 的 DER 为 3.959%,Nemotron 3 为 4.971%,Sortformer v2.1 为 6.958%。VibeVoice 的两个版本(1.5B 和 7B)DER 分别达到 17.210% 和 18.032%,与离线批处理相比下降明显。

作者特别说明,Nemotron 3 与 Sortformer v2.1 使用的是原生流式预设,通过「不按时间推进的完整文件回放」评估;其余模型采用按节奏输出说话人结果的方式,因此这些分数并不能直接反映真实在线延迟。Meta Muse 未参与流式测试。

自研推理运行时带来的额外提升

作者还在不改动模型权重的前提下,使用 Omi 自有的推理运行时对 Nemotron 3 和 Pyannote Community-1 进行了优化:

  • Nemotron 3:DER 从 4.803% 降至 3.174%,相对误差降低 34%,速度提升至 2.13 倍
  • Community-1:DER 从 6.620% 降至 5.435%,相对误差降低 18%,速度提升至 24 倍

不过在零边界容忍度下,Nemotron 3 的运行时分反而从 12.720% 上升到 13.203%。作者承认测试样本量较小,且参考标注经过了 VAD(语音活动检测)精修,运行时的调参也在该数据集上完成,存在一定的过拟合风险。

可复现性

作者表示,测试所用的音频、参考标注、打分脚本、推理输出以及 NVIDIA 基线运行脚本均已开源,便于社区复现与重新打分。其自研运行时的代码保持闭源,但最终输出已一并发布以便独立评分。

信源