桃子桃子快讯
返回首页
开源

Orukeet:基于 Parakeet 改进的多语言语音识别模型

Orukeet 是一个支持 25 种语言的语音识别模型,基于 NVIDIA Parakeet TDT 0.6B v3 改…

2026.09.11 · 周五2 分钟阅读

近日,社区中出现了一款名为 Orukeet 的开源自动语音识别(ASR)模型。该模型基于 NVIDIA Parakeet TDT 0.6B v3 构建,覆盖 25 种语言,在多项公开基准测试中较原版 Parakeet 有所提升。项目权重已在 Hugging Face 上公开发布。

模型背景与技术改进

Orukeet 并非从头训练的新模型,而是在 NVIDIA Parakeet TDT 0.6B v3 的基础上进行改造。其核心技术改动是:将编码器中一半的时序深度卷积滤波器替换为 12,288 个预先拟合、推理时冻结的 Gabor 核函数,其余参数则在多语言、多口音数据上进行继续训练。这种"冻结结构 + 可学习参数"的混合方案,旨在以较低的训练成本引入归纳偏置,从而改善跨语种与跨口音的鲁棒性。项目作者在介绍中特别提到,该模型在 Mac 等设备上的实际体验有所改善。

基准测试结果

根据项目方公布的对比数据,Orukeet 在 74 个测试划分中,有 61 个优于原始 Parakeet,具体数字如下:

  • LibriSpeech test-clean:1.46% WER(Parakeet 为 1.53%)
  • LibriSpeech test-other:2.86% WER(Parakeet 为 3.14%)
  • FLEURS 英文:3.82% WER(Parakeet 为 4.28%)

在覆盖全部 25 种语言的 FLEURS 测试集上,合并 WER 为 9.85%,相比 Parakeet 的 11.01% 实现 10.6% 的相对下降。最终的自适应与检查点选择阶段基于 LibriSpeech test-other 完成。

模型来源与可用性

Orukeet 的权重托管在 Hugging Face,仓库路径为 huggingface.co/oruk/orukeet。模型卡中说明了语言覆盖、训练数据来源以及与原版 Parakeet 的差异点,便于开发者复现或进行二次微调。该模型定位为 Parakeet 的轻量级"改进版",适合对多语种语音识别有需求、且希望获得比官方版本更优效果的用户试用与评估。

信源