高中生开发者开源 Inflect v2:400 万参数完整 TTS 模型
独立开发者开源 Inflect v2 系列超小型 TTS 模型,Nano 版仅 3.96M 参数,可在 CPU 上实时推…
一名高中开发者近日在 Reddit r/LocalLLaMA 社区发布了 Inflect v2 系列文本转语音(TTS)模型,主打极小参数规模下的端到端语音合成能力。两款模型均为完整 TTS 流程——文本处理、时间预测、语音生成与波形解码器全部内置,无需外挂声码器或调用在线 API,输入文本即可直接输出 24 kHz 音频。
模型规格与定位
Inflect v2 包含两款模型:
- Inflect-Nano-v2:3.96M 参数,FP32 权重约 15.97 MB,主打最小体积。
- Inflect-Micro-v2:9.36M 参数,FP32 权重约 37.53 MB,在 Nano 基础上提升清晰度、稳定性与整体音质。
两款模型均可通过同一套 PyTorch 接口在 CPU 或 CUDA 上本地运行。开发者表示,Nano 是目前他已知「仍能生成真正可用语音」的最小完整神经 TTS 模型之一;即使是 9.36M 的 Micro,也比许多被冠以「tiny」之名的系统更小。
作为参考,Nano 的参数规模约为 Kokoro 的 1/21、Chatterbox 的 1/126、Fish Audio S2 Pro 的 1/1000 以下。但开发者强调这只是参数层面的对比,三者在架构、数据集与目标场景上不可直接互换。
性能与基准
相较上个月发布的 4.63M 实验版本 Inflect-Nano-v1,v2 是完全重写而非简单延长训练,主要解决了 v1 暴露的问题:时间预测不稳、金属感音色、韵律弱、难文本泛化差以及波形解码器容量不足。
官方公布的 benchmark 数据如下:
- Micro:UTMOS22 得分 4.395,语义 WER 3.99%,CPU 推理速度 6.28× 实时。
- Nano:UTMOS22 得分 4.386,语义 WER 4.21%,CPU 推理速度 10.72× 实时。
- 在一项面向紧凑型 TTS 的盲测社区对比中,Micro 与 Nano 分别位列第二、第三。
局限与未来方向
两款模型仍存在明确短板:
- 仅支持英文。
- 内置单一固定男声,不支持声音克隆。
- 难处理生僻姓名、缩写、数字与同形异义词。
- Nano 音质相对偏薄,两款模型偶有金属感或截断失真。
开发者表示,若社区反馈积极,可能推进 v3 版本,重点从「进一步缩小体积」转向「扩展能力」——增加声音、可能引入更多语言、降低微调门槛,并再做一轮质量与稳健性打磨。
试用方式
最快体验途径是 Hugging Face 上的交互式 Playground;模型权重与代码仓库也已公开:
- 体验:https://huggingface.co/spaces/owensong/Inflect-v2
- Micro 权重:https://huggingface.co/owensong/Inflect-Micro-v2
- Nano 权重:https://huggingface.co/owensong/Inflect-Nano-v2
- 代码与文档:https://github.com/owenawsong/Inflect
开发者特别邀请社区用难例(生僻姓名、数字、缩写、刁钻标点或长句)进行测试,并反馈具体文本、模型、种子与硬件配置,以便后续迭代。
