开源
Neuphonic 开源 NeuTTS-2E:端侧运行的情感可控 TTS 模型
Neuphonic 发布开源端侧 TTS 模型 NeuTTS-2E,仅 1.25 亿活跃参数,支持 7 种情感可控演绎。
2026.07.22 · 周三约 3 分钟阅读
语音 AI 公司 Neuphonic 近日以 Alpha 形式开源了端侧 TTS 模型 NeuTTS-2E,仅 1.25 亿活跃参数即可在本地硬件上生成带有情感表达的英语语音,并提供 7 种可控情感供调用方直接选择。该版本在 Neuphonic 现有产品线中体积最小,主打离线推理与隐私保护,目标场景是不希望语音数据外传的本地应用。
模型概述与核心特性
NeuTTS-2E 的核心卖点是「情感可控」:用户可以在生成时显式指定「愤怒」「恐惧」「快乐」等情感标签,让模型按指定情绪演绎,而不是像多数 TTS 那样由模型自行从文本推断情绪。
- 支持 7 种情感标签,可在每次生成时单独指定。
- 切换情感时保持说话人音色一致,允许同一声音以不同情绪朗读同一段文本。
- 仅 1.25 亿活跃参数,是 Neuphonic 迄今最小的模型,适合在用户自有设备上运行。
- 内置 4 个默认说话人,可开箱即用。
- 文本与音频均无需上传服务器,强调本地隐私。
训练中的主要挑战
Neuphonic 在公告中提到,团队在构建该模型时主要应对了三类问题:
- 情感语音数据稀缺,可用于监督训练的高质量样本有限。
- 现有数据集中情感标签噪声较大,可靠性参差不齐。
- 口语中的情感与文本语义高度耦合,难以在不破坏语义的前提下单独控制情绪。
公司将这一版本定位为「早期 Alpha」,目的是尽快收集社区反馈,观察真实使用场景中的表现,并据此迭代。
开源协议与获取方式
NeuTTS-2E 采用 NeuTTS Open License 开源协议,代码与权重已在 GitHub 和 Hugging Face 同步发布,并附带交互式 Demo:
- GitHub:https://github.com/neuphonic/neutts
- HugHub Face 模型集合:https://huggingface.co/collections/neuphonic/neutts-2e
- 交互 Demo:https://huggingface.co/spaces/neuphonic/neutts-2e
- 官方介绍:https://www.neuphonic.com/models/neutts-2e
Neuphonic 表示欢迎社区试用并提交反馈,后续将基于实际使用情况继续打磨该模型。
