桃子桃子快讯
返回首页
开源

高中生开发者开源 Inflect v2:400 万参数完整 TTS 模型

独立开发者开源 Inflect v2 系列超小型 TTS 模型,Nano 版仅 3.96M 参数,可在 CPU 上实时推…

2026.07.25 · 周六4 分钟阅读

一名高中开发者近日在 Reddit r/LocalLLaMA 社区发布了 Inflect v2 系列文本转语音(TTS)模型,主打极小参数规模下的端到端语音合成能力。两款模型均为完整 TTS 流程——文本处理、时间预测、语音生成与波形解码器全部内置,无需外挂声码器或调用在线 API,输入文本即可直接输出 24 kHz 音频。

模型规格与定位

Inflect v2 包含两款模型:

  • Inflect-Nano-v2:3.96M 参数,FP32 权重约 15.97 MB,主打最小体积。
  • Inflect-Micro-v2:9.36M 参数,FP32 权重约 37.53 MB,在 Nano 基础上提升清晰度、稳定性与整体音质。

两款模型均可通过同一套 PyTorch 接口在 CPU 或 CUDA 上本地运行。开发者表示,Nano 是目前他已知「仍能生成真正可用语音」的最小完整神经 TTS 模型之一;即使是 9.36M 的 Micro,也比许多被冠以「tiny」之名的系统更小。

作为参考,Nano 的参数规模约为 Kokoro 的 1/21、Chatterbox 的 1/126、Fish Audio S2 Pro 的 1/1000 以下。但开发者强调这只是参数层面的对比,三者在架构、数据集与目标场景上不可直接互换。

性能与基准

相较上个月发布的 4.63M 实验版本 Inflect-Nano-v1,v2 是完全重写而非简单延长训练,主要解决了 v1 暴露的问题:时间预测不稳、金属感音色、韵律弱、难文本泛化差以及波形解码器容量不足。

官方公布的 benchmark 数据如下:

  • Micro:UTMOS22 得分 4.395,语义 WER 3.99%,CPU 推理速度 6.28× 实时。
  • Nano:UTMOS22 得分 4.386,语义 WER 4.21%,CPU 推理速度 10.72× 实时。
  • 在一项面向紧凑型 TTS 的盲测社区对比中,Micro 与 Nano 分别位列第二、第三。

局限与未来方向

两款模型仍存在明确短板:

  • 仅支持英文。
  • 内置单一固定男声,不支持声音克隆。
  • 难处理生僻姓名、缩写、数字与同形异义词。
  • Nano 音质相对偏薄,两款模型偶有金属感或截断失真。

开发者表示,若社区反馈积极,可能推进 v3 版本,重点从「进一步缩小体积」转向「扩展能力」——增加声音、可能引入更多语言、降低微调门槛,并再做一轮质量与稳健性打磨。

试用方式

最快体验途径是 Hugging Face 上的交互式 Playground;模型权重与代码仓库也已公开:

开发者特别邀请社区用难例(生僻姓名、数字、缩写、刁钻标点或长句)进行测试,并反馈具体文本、模型、种子与硬件配置,以便后续迭代。

信源