Orukeet:基于 Parakeet 改进的多语言语音识别模型
Orukeet 是一个支持 25 种语言的语音识别模型,基于 NVIDIA Parakeet TDT 0.6B v3 改…
近日,社区中出现了一款名为 Orukeet 的开源自动语音识别(ASR)模型。该模型基于 NVIDIA Parakeet TDT 0.6B v3 构建,覆盖 25 种语言,在多项公开基准测试中较原版 Parakeet 有所提升。项目权重已在 Hugging Face 上公开发布。
模型背景与技术改进
Orukeet 并非从头训练的新模型,而是在 NVIDIA Parakeet TDT 0.6B v3 的基础上进行改造。其核心技术改动是:将编码器中一半的时序深度卷积滤波器替换为 12,288 个预先拟合、推理时冻结的 Gabor 核函数,其余参数则在多语言、多口音数据上进行继续训练。这种"冻结结构 + 可学习参数"的混合方案,旨在以较低的训练成本引入归纳偏置,从而改善跨语种与跨口音的鲁棒性。项目作者在介绍中特别提到,该模型在 Mac 等设备上的实际体验有所改善。
基准测试结果
根据项目方公布的对比数据,Orukeet 在 74 个测试划分中,有 61 个优于原始 Parakeet,具体数字如下:
- LibriSpeech test-clean:1.46% WER(Parakeet 为 1.53%)
- LibriSpeech test-other:2.86% WER(Parakeet 为 3.14%)
- FLEURS 英文:3.82% WER(Parakeet 为 4.28%)
在覆盖全部 25 种语言的 FLEURS 测试集上,合并 WER 为 9.85%,相比 Parakeet 的 11.01% 实现 10.6% 的相对下降。最终的自适应与检查点选择阶段基于 LibriSpeech test-other 完成。
模型来源与可用性
Orukeet 的权重托管在 Hugging Face,仓库路径为 huggingface.co/oruk/orukeet。模型卡中说明了语言覆盖、训练数据来源以及与原版 Parakeet 的差异点,便于开发者复现或进行二次微调。该模型定位为 Parakeet 的轻量级"改进版",适合对多语种语音识别有需求、且希望获得比官方版本更优效果的用户试用与评估。
