Audio8 发布 0.6B 多语言 TTS 模型,支持零样本声音克隆
AutoArk-AI 开源 0.6B 参数多语言 TTS 预览模型,支持 11 种语言与零样本声音克隆,体积小但 See…
Audio8 团队近日在 Hugging Face 开源了 Audio8 TTS Preview 0.6B,这是一款参数规模约 6 亿的多语言文本转语音模型,主打零样本声音克隆能力。尽管体积较小,官方称其在 Seed-TTS 与 CV3 多语言评测上已进入一线 TTS 模型行列。
模型架构与技术规格
Audio8 TTS 采用 DualAR 双自回归架构,设计灵感来自 Fish Audio S2 Pro。该架构由两个 AR Transformer 组成:慢速 AR 负责为每一帧音频预测一个语义 token,快速 AR 则在该语义 token 的条件下预测该帧的声学 codebook。模型主干参数为 601,159,424(不含 codec),其中:
- 慢速 AR:24 层,宽度 896,14 个注意力头,2 个 KV 头
- 快速 AR:4 层,宽度 896,14 个注意力头,2 个 KV 头
- 声学 token:10 个 codebook,每个 4,096 条目
- 音频 codec:44.1 kHz,每模型帧 2,048 采样(约 21.5 帧/秒)
- 上下文长度:最多 2,048 个打包的文本/音频位置
模型自带 44.1 kHz 神经音频 codec,可同时处理参考音频编码与波形解码,无需额外加载 codec 权重。
语言覆盖与使用方式
Preview 阶段语言支持较为克制,官方推荐使用以下 11 种语言以获得最佳效果:粤语、中文、荷兰语、英语、法语、德语、意大利语、日语、韩语、波兰语、西班牙语。官方表示更广泛的多语言覆盖与中文方言支持将在后续版本中提供。
环境要求 Python 3.10 及以上,并建议配备 CUDA GPU。依赖包括 torch ≥ 2.5.0、torchaudio ≥ 2.5.0、transformers ≥ 4.57.0(< 5)、soundfile ≥ 0.12、safetensors ≥ 0.4。模型使用自定义 Transformers 代码,需通过 trust_remote_code=True 加载。仓库 ID 为 AutoArk-AI/Audio8-TTS-Preview-0.6b。
基准评测表现
官方将 Audio8 TTS Preview 与 Fish S2 Pro(4.6B)、Higgs Audio v2(4.7B)、CosyVoice3-1.5B、MOSS-TTS(8.5B)、VoxCPM2(2.3B)进行了对比。
在 Seed-TTS 上:
- 英文 WER:1.506(最佳),相似度 63.2%
- 中文 CER:0.950,相似度 73.1%
- 困难中文 CER:11.510,相似度 68.7%
在 CV3 多语言错误率上,Audio8 TTS Preview 在英文(3.128)、韩语(3.447)、意大利语(4.223)等多个语种上取得最低或接近最低的错误率。
需要注意的是,不同项目使用各自的 normalizer 与评测脚本,跨项目数值仅可作为参考而非严格排名。此外,CV3 上的评测覆盖并不意味着 Preview 权重突破了 11 种语言的官方支持声明。
局限与负责任使用
官方在仓库中明确了几点限制:Preview 权重多语言与方言覆盖有限;过长的、含噪的或转录错误的参考音频会降低稳定性与音色相似度;生成的语音存在被用于冒充或制造虚假信息的风险,克隆他人声音前应取得同意。
