桃子桃子快讯
返回首页
开源

Neuphonic 开源 NeuTTS-2E:端侧运行的情感可控 TTS 模型

Neuphonic 发布开源端侧 TTS 模型 NeuTTS-2E,仅 1.25 亿活跃参数,支持 7 种情感可控演绎。

2026.07.22 · 周三3 分钟阅读

语音 AI 公司 Neuphonic 近日以 Alpha 形式开源了端侧 TTS 模型 NeuTTS-2E,仅 1.25 亿活跃参数即可在本地硬件上生成带有情感表达的英语语音,并提供 7 种可控情感供调用方直接选择。该版本在 Neuphonic 现有产品线中体积最小,主打离线推理与隐私保护,目标场景是不希望语音数据外传的本地应用。

模型概述与核心特性

NeuTTS-2E 的核心卖点是「情感可控」:用户可以在生成时显式指定「愤怒」「恐惧」「快乐」等情感标签,让模型按指定情绪演绎,而不是像多数 TTS 那样由模型自行从文本推断情绪。

  • 支持 7 种情感标签,可在每次生成时单独指定。
  • 切换情感时保持说话人音色一致,允许同一声音以不同情绪朗读同一段文本。
  • 仅 1.25 亿活跃参数,是 Neuphonic 迄今最小的模型,适合在用户自有设备上运行。
  • 内置 4 个默认说话人,可开箱即用。
  • 文本与音频均无需上传服务器,强调本地隐私。

训练中的主要挑战

Neuphonic 在公告中提到,团队在构建该模型时主要应对了三类问题:

  • 情感语音数据稀缺,可用于监督训练的高质量样本有限。
  • 现有数据集中情感标签噪声较大,可靠性参差不齐。
  • 口语中的情感与文本语义高度耦合,难以在不破坏语义的前提下单独控制情绪。

公司将这一版本定位为「早期 Alpha」,目的是尽快收集社区反馈,观察真实使用场景中的表现,并据此迭代。

开源协议与获取方式

NeuTTS-2E 采用 NeuTTS Open License 开源协议,代码与权重已在 GitHub 和 Hugging Face 同步发布,并附带交互式 Demo:

Neuphonic 表示欢迎社区试用并提交反馈,后续将基于实际使用情况继续打磨该模型。

信源