桃子桃子快讯
返回首页
开源

Gepard TTS 在 Coval 基准登顶延迟榜,单卡 RTX 4090 即可运行

nineninesix 团队将 Apache 2.0 开源的 Gepard TTS 模型跑通 Coval 公共基准,首音…

2026.08.27 · 周四2 分钟阅读

语音合成(TTS)领域近期出现一款值得关注的开源方案:nineninesix 团队在 Reddit r/LocalLLaMA 板块公布,他们将旗下 Apache 2.0 授权的 Gepard TTS 模型接入 Coval 的公共 TTS 基准进行测试,结果显示其首音频延迟(TTFA)在单一 RTX 4090 上即低于该榜单此前公布的所有数字。

基准测试核心数据

Gepard 1.0 在 Coval 公开基准(25 个 API 在榜)上的关键指标如下:

  • 首音频延迟 TTFA:68.7 ms(p50 中位数)
  • p90 延迟:85.8 ms
  • 最差样本:104.8 ms
  • 起始静音段:20.5 ms
  • 词错误率 WER:5.23%

团队声明,该 TTFA 中位数低于 Coval 榜单上所有已发布的数字。需要指出的是,团队是从加州直连自家 API 进行测试,网络往返已被归一化扣除;而 Coval 自身跑出的数据行未做归一化,受其 runner 的网络路径影响,因此双方数据并非严格同口径对比。团队也表示,更希望由 Coval 官方亲自复测。

硬件与部署门槛

不同于多数需要在多卡服务器或专用推理集群上运行的大模型,Gepard 1.0 仅需单张 RTX 4090 即可在 Runpod 等平台完成推理。这一硬件门槛对个人开发者和中小团队较为友好,也使其在开源 TTS 方案中具备一定的部署成本优势。

开源与可复现性

Gepard 的模型权重采用 Apache 2.0 协议发布,是 Coval 榜单 25 个 API 中唯一采用该协议的开源选项(其余 24 个均为闭源)。团队同步开源了基准复现脚本,托管在 GitHub 仓库 nineninesix-ai/benchmarks,支持通过 vllm 对自有模型进行测试,方法、图表与完整说明见其官方博客。

局限与注意事项

  • 该结果由模型作者自行跑出并发布,并非独立第三方评测。
  • 评测方同时也是被测方的 API 提供者,存在自我优化的可能性。
  • 与榜单其他 API 的对比未完全消除网络与硬件差异,需等待 Coval 官方统一环境复测。
  • 评测重点是延迟与 WER,未覆盖音色自然度、多语言能力、长文本稳定性等同样重要的维度。
信源