开源
Gepard TTS 在 Coval 基准登顶延迟榜,单卡 RTX 4090 即可运行
nineninesix 团队将 Apache 2.0 开源的 Gepard TTS 模型跑通 Coval 公共基准,首音…
2026.08.27 · 周四约 2 分钟阅读
语音合成(TTS)领域近期出现一款值得关注的开源方案:nineninesix 团队在 Reddit r/LocalLLaMA 板块公布,他们将旗下 Apache 2.0 授权的 Gepard TTS 模型接入 Coval 的公共 TTS 基准进行测试,结果显示其首音频延迟(TTFA)在单一 RTX 4090 上即低于该榜单此前公布的所有数字。
基准测试核心数据
Gepard 1.0 在 Coval 公开基准(25 个 API 在榜)上的关键指标如下:
- 首音频延迟 TTFA:68.7 ms(p50 中位数)
- p90 延迟:85.8 ms
- 最差样本:104.8 ms
- 起始静音段:20.5 ms
- 词错误率 WER:5.23%
团队声明,该 TTFA 中位数低于 Coval 榜单上所有已发布的数字。需要指出的是,团队是从加州直连自家 API 进行测试,网络往返已被归一化扣除;而 Coval 自身跑出的数据行未做归一化,受其 runner 的网络路径影响,因此双方数据并非严格同口径对比。团队也表示,更希望由 Coval 官方亲自复测。
硬件与部署门槛
不同于多数需要在多卡服务器或专用推理集群上运行的大模型,Gepard 1.0 仅需单张 RTX 4090 即可在 Runpod 等平台完成推理。这一硬件门槛对个人开发者和中小团队较为友好,也使其在开源 TTS 方案中具备一定的部署成本优势。
开源与可复现性
Gepard 的模型权重采用 Apache 2.0 协议发布,是 Coval 榜单 25 个 API 中唯一采用该协议的开源选项(其余 24 个均为闭源)。团队同步开源了基准复现脚本,托管在 GitHub 仓库 nineninesix-ai/benchmarks,支持通过 vllm 对自有模型进行测试,方法、图表与完整说明见其官方博客。
局限与注意事项
- 该结果由模型作者自行跑出并发布,并非独立第三方评测。
- 评测方同时也是被测方的 API 提供者,存在自我优化的可能性。
- 与榜单其他 API 的对比未完全消除网络与硬件差异,需等待 Coval 官方统一环境复测。
- 评测重点是延迟与 WER,未覆盖音色自然度、多语言能力、长文本稳定性等同样重要的维度。
