独立开发者开源移动端 TTS 模型 Scylla's Band
个人开发者耗时半年自学的 TTS 项目,支持 10 种语音、3 种语言与 7 种情绪,覆盖 ONNX/LiteRT 移动…
一位独立开发者在 Reddit r/LocalLLaMA 社区发布了名为「Scylla's Band」的端到端 TTS(文本转语音)项目,同时放出推理框架与模型权重。该项目以个人学习为起点,历时约六个月完成,重点解决移动端实时语音合成的性能与轻量化问题。
项目概览
Scylla's Band 在功能上覆盖:
- 10 种预置语音,涵盖 7 种可配置情绪/情感状态;
- 每种语音支持 3 种语言:英语(含 en_us 与 en_gb)、西班牙语、意大利语;
- 在三星 Fold 7 上首包音频延迟约 500–800ms,随后以流式方式持续输出,不存在明显断句;
- 推理栈基于 C++ 自研,配合 ONNX 与 LiteRT 后端,跨 Linux、macOS、Android 平台运行。
开发者明确将「对标或超越 Kokoro 在移动端的性能」作为目标基线之一,并强调不依赖 eSpeak。G2P(字素到音素)模块基于 DeepPhonemizer 自建数据集训练,覆盖美式/英式英语、意大利语和西班牙语,便于后续扩展更多音素类语言。
技术栈与推理框架
项目代码仓库中除模型外,还包含:
- C++ 文本规范化库;
- 基于 ONNX 或 LiteRT 的推理调用层;
- 一个 Android 示例 App,可在运行时动态切换语音、语言与情绪。
macOS 端已测试 M2、M4、M5 芯片,Android 端仅在三星 Fold 7 上完成验证,iOS 示例 App 尚未构建。开发者表示目前性能与质量的部分提升来自自研推理栈的若干优化,但未公开具体 benchmark 数字。
与主流 TTS 的定位差异
- 移动端优先:在低端算力设备上保持 500–800ms 首包延迟与持续流式输出;
- 多语言同步:每种语音自带多语言支持,无需切换模型;
- 情绪可控:7 种情感配置作为一等公民能力开放。
现状与未来计划
当前版本已满足开发者为自己设定的六项基线要求中的前五项,包括移动端性能、轻量化、规避 eSpeak、情绪控制以及多语言支持。语音克隆(第六项)仍在迭代中,开发者对公开发布该能力持谨慎态度,担心只覆盖音色/音高会引发误用。
后续路线图包含:增加更多语言、改进情绪控制粒度、补齐 iOS 示例 App。开发者以个人项目形式维护,未承诺时间表,邀请社区在 GitHub 提 issue 反馈问题。
仓库地址:https://github.com/lowkeytea/scyllasband 模型与 LiteRT/ONNX 资源:https://huggingface.co/spybyscript/scyllasband 语音与多语言样例:https://lowkeytea.github.io/scyllasband/
