桃子桃子快讯
返回首页
模型发布

NVIDIA 开源 Nemotron 3 说话人分离模型

NVIDIA 发布 1 亿参数开源模型 Nemotron 3 Diarization,支持最多 8 人实时说话人分离,在…

2026.09.23 · 周三3 分钟阅读

NVIDIA 近日在 Hugging Face Blog 正式介绍了 Nemotron 3 Diarization——一款面向多人对话场景的开源说话人分离(speaker diarization)模型。该模型仅含 1 亿参数,却在 Voice Arena 首次公布的 Diarization-Bench 榜单上以 14.72% 的复合错误率(DER)位列第一,支持离线与流式两种推理模式。

模型亮点与能力

Nemotron 3 Diarization 最多可识别 8 位说话人,并能处理同一时刻多人同时开口的重叠语音场景。相比前代 Streaming Sortformer 仅支持 4 人的方案,新模型在支持人数与识别精度上均有明显扩展。

主要特性包括:

  • 开源权重:1 亿参数规模,便于二次开发与本地部署。
  • 多场景适配:覆盖会议记录、客服通话、播客字幕等实时与离线场景。
  • 可调延迟:通过右上下文与 FIFO 队列控制,支持不同流式延迟档位。
  • 重叠语音处理:天然支持同一帧内多人同时说话。

训练数据与改进幅度

研究团队使用公共语音数据以及来自 David AI 的多说话人授权语料训练模型,其中包含真实多说话人对话,以及覆盖 21 种语言的大规模合成混合音频。引入 David AI 数据后,模型在离线与超低延迟两档设置中,复合 DER 绝对值均下降 0.77 个百分点,从 11.19% 降至 10.42%。

架构与推理机制

模型接收 16 kHz 单声道音频,先转换为 Mel 频谱特征(10 ms 帧步长),再以 8 倍堆叠形成 80 ms 帧,输入 31 层 Transformer 编码器,并使用旋转位置编码(RoPE)。编码器之上是一层 Conv1D,将预测上采样回输入特征分辨率,输出一个 [T, 8] 的浮点张量——T 个时间步 × 8 个说话人通道,每一格代表对应说话人在当前时刻的活跃概率,输出步长可配置为 10 ms 的整数倍。

流式推理中包含两类记忆:

  • AOSC(Arrival-Order Speaker Cache):按出现顺序组织已识别说话人信息,使跨块标签保持稳定。
  • FIFO 队列:保留最近帧上下文,辅助当前块判断。

此外,模型还可在当前块后附带"右上下文"音频用于判断说话人切换,但会牺牲部分实时性。模型采用"按到达时间排序输出通道"的设计:第一个新声音被分配到第一个通道,第二个新声音分配到第二个通道,依此类推,从而避免每块都需重新做说话人排列的问题。

与说话人归属 ASR 的区别

需要特别说明的是,Nemotron 3 Diarization 输出的只是"哪段时间是哪位匿名说话人"的标签,并不直接识别真人身份。要实现"张三在 12:30 说了什么"这种归属,仍需将其时间戳与 ASR 转写、用户档案或声纹验证模型结合使用。该模型的角色是把"谁在何时说话"这一步做扎实,为下游多说话人 ASR 与会议结构化提供基础。

信源