桃子桃子快讯
返回首页
开源

Sopro V2 Turbo 开源:120M 参数,可在 CPU 上跑的语音克隆 TTS

Halo NeuroAI 开源 120M 参数语音克隆 TTS 模型 Sopro V2 Turbo,支持四国语言并原生支…

2026.08.28 · 周五4 分钟阅读

语音技术公司 Halo NeuroAI 近日开源了 Sopro V2 Turbo,一个 120M 参数的语音克隆 TTS 模型。该模型可以在笔记本 CPU 或浏览器中直接运行,原生支持英语、德语、法语以及欧洲葡萄牙语,号称是首个以欧洲葡萄牙语为目标语种的开放 TTS 模型。

性能与部署

Sopro V2 Turbo 在 Apple M3 CPU 上离线生成可达 0.24 real-time factor(RTF,生成时间 / 音频时长),流式输出首音频延迟约 300 毫秒、RTF 0.21;在单卡 H100 上离线 RTF 可低至 0.07,流式首音频延迟约 200 毫秒。所有数据均为单流 PyTorch 默认配置、无批处理得出。

部署方式包括:

  • 一行命令启动本地 demo:uvx --from sopro soprotts serve
  • 提供完全运行在浏览器内的 ONNX demo,无需服务器
  • 在移动端会自动量化,但低端内存设备可能崩溃

研发背景

Sopro 项目源于 Halo NeuroAI 联合创始人在 2025 年 12 月假期中的个人尝试。Halo 的主营业务是为 ALS、中风后失语症患者恢复「声音」,但他们在使用 OpenAI、Cartesia、ElevenLabs 等主流语音克隆服务时发现,由于巴西葡萄牙语数据的偏差,这些模型对欧洲葡萄牙语的发音总是不准,绕过方案又会显著增加延迟,OpenAI 高质量版本生成一句话要 4–6 秒,对实时沟通是致命的。

受限于预算,团队只能训练极小的模型,这也意外让他们发现了本地、快速 TTS 这一市场空白。第一代 Sopro V1 曾登顶 Hacker News 第二名,但存在不稳定、克隆质量不一致、仅支持英语等问题。后续凭借与葡萄牙国家计算网络 FCCN-FCT 的合作,使用 Deucalion 和 MareNostrum 5 两台超算完成了 V2 的训练。

架构演进

Sopro V2 在 V1 的基础上对几乎每个组件都做了替换或改进:

  • 文本分词:弃用 Llama 的 128k 词表(仅 embedding 表就占 ~49M 参数),改用 8192 token 的 SentencePiece unigram 分词器。
  • AR 主干:将 V1 的卷积自回归模型替换为带 RoPE、RMSNorm 与分组查询注意力的 Transformer 解码器,原因是卷积模型「太近视」会导致重复。
  • 参考输入:不像 CosyVoice 系列那样需要参考音频的转录,prompt 仅由参考的语义 token 加少量风格 token 组成,推理时省去 ASR 依赖。
  • 声学头:从离散 acoustic codebook 改为连续 flow-matching 头,最终采用 F5-TTS / CosyVoice 路线,以 mel 频谱作为声学前端,并通过条件掩码进一步提升稳定性。

定位与局限

Sopro V2 Turbo 仍是「小、快、本地」路线上的探索:参数规模 120M 决定了它不可能在音色还原度和自然度上与 ElevenLabs、OpenAI 顶级云端模型正面竞争,但其优势在于延迟、可控性与隐私。对于欧洲葡萄牙语用户、失语症患者辅助沟通等场景,它填补了开源方案中长期缺位的一环。目前项目尚未融资,计算资源依赖合作伙伴提供。

信源