工具
开发者开源桌面端 TTS 工具:支持多模型切换与音色克隆
Reddit 用户发布基于 Tkinter 的桌面 GUI,整合 Kokoro、Chatterbox 等本地 TTS 模…
2026.07.26 · 周日约 2 分钟阅读
近日,Reddit 用户 AmitTzah 在 r/LocalLLaMA 板块开源了一款名为 TTS-Studio 的桌面端语音合成工具。该应用基于 Python Tkinter 构建,主打轻量与多 TTS 引擎切换,目前已支持 Kokoro 和 Chatterbox 两个本地模型,后续将接入更多引擎。
主要功能
工具面向本地部署场景,当前版本提供以下能力:
- 文本分段合成:可将较长文本拆分为多个片段,并在片段间插入自定义停顿。这是因为小参数 TTS 模型在处理超过一两段文本时容易出现语义混乱,分段处理可显著提升输出稳定性。
- 音色克隆:在 Chatterbox 引擎下,用户可通过上传参考音频来克隆特定说话人音色。
- 模型直连下载:内置 Hugging Face 模型拉取功能,无需手动配置下载流程。
- 轻量播放器与文件输出:自带简易音频播放器,合成结果保存为 wav 文件。
开发背景
作者在帖子中透露,整个项目由 DeepSeek v4 协助编写,并辅以大量人工调试,整体开发成本不足 5 美元。他表示选择本地 TTS 的主要原因是希望在不同引擎间灵活切换,而不愿依赖臃肿的集成方案。
局限与定位
TTS-Studio 目前仍是个人项目级别工具,UI 较为朴素,功能聚焦于本地小模型的快速对比与试用,适合需要同时测试多个开源 TTS 引擎的开发者或爱好者使用。项目代码已在 GitHub 开源(仓库:AmitTzah/TTS-Studio),后续将随引擎支持扩展继续更新。
