桃子桃子快讯
返回首页
开源

FireRed团队开源两款音频模型:统一理解与生成、多语言TTS

FireRedTeam发布FireRedAudio(9B参数统一音频语言模型)与FireRedTTS3(支持24种语言、…

2026.08.22 · 周六4 分钟阅读

小红书 FireRedTeam 团队近日在 Hugging Face 上线两款开源音频模型——FireRedAudio 与 FireRedTTS3,前者定位为统一的音频理解与生成大模型,后者专注多语言、多方言的语音合成与编辑,两者均同步开源权重、GitHub 仓库、arXiv 论文与可交互 Demo。

FireRedAudio:首个公开的「解耦表示」统一音频语言模型

FireRedAudio 基于一个共享的 9B 参数大语言模型底座构建,采用「解耦的连续表示」设计:将 Audio Encoder 通路用于音频理解,RedAE-Patch 通路用于语音生成,两类表示在底层保持分离,但共享同一套语言与推理骨架。团队表示,这是首个公开披露的此类统一音频语言模型架构。

单个模型即可覆盖完整的音频任务栈,包括:

  • ASR(自动语音识别)
  • 通用与细粒度音频理解
  • 零样本 TTS
  • 指令式 TTS
  • 语义/声学语音编辑
  • 对最长约 1 小时的音频进行时间戳对齐与推理

在 MMAU、MMSU、Seed-TTS-Eval、InstructTTSEval、Ming-Freeform-Audio-Edit 等基准上,FireRedAudio 取得「具有竞争力或领先」的成绩。用户可通过自然语言完成声音克隆、声音设计、语音内容与风格的编辑。

FireRedTTS3:24 种语言与 21 种汉语方言

FireRedTTS3 基于「语义增强的连续语音表示」,提供两个变体:

  • FireRedTTS3-Base:覆盖 24 种语言、21 种汉语方言的零样本声音克隆
  • FireRedTTS3-Instruct:自然语言驱动的语音设计与统一编辑(语义+声学)

基准成绩方面,团队报告在 MiniMax-MLS-Test 上取得最佳平均 WER/CER 约 3.754%、最佳平均说话人相似度约 84.8%;在 Seed-TTS-eval 上克隆 WER/CER 约 3.04%、相似度约 78.8%。

24 种支持语言包括阿拉伯语、粤语、中文、捷克语、荷兰语、英语、芬兰语、法语、德语、希腊语、印地语、印尼语、意大利语、日语、韩语、波兰语、葡萄牙语、罗马尼亚语、俄语、西班牙语、泰语、土耳其语、乌克兰语、越南语。

21 种汉语方言覆盖安徽、福建、甘肃、贵州、河北、河南、湖北、湖南、江西、辽宁、闽南、宁夏、陕西、山东、上海、山西、四川、天津、温州、吴语、云南等主要方言区。

Instruct 变体支持从性别、年龄、音色、情感、语速、口音等自然语言描述生成全新声音,无需参考音频;同时支持自由形式的语音编辑,包括插入、删除、替换等语义操作与语速、音量、音高等声学操作。

FireRedTeam 的开源生态

除上述两款模型外,FireRedTeam 此前已开源或发表多项工作,包括:

  • OpenStoryline:面向自主、人对齐视频创作的智能体框架
  • FireRedChat:全自托管全双工语音交互方案
  • FireRedASR:工业级开源 ASR 模型
  • FireRedTTS-2:面向播客与聊天的长对话语音生成
  • InstantID、InstantStyle、StoryMaker、LayerDiffuse-Flux 等图像生成相关项目

FireRedAudio 与 FireRedTTS3 的权重、推理代码与 Demo 已发布在 Hugging Face 和 GitHub,论文可在 arXiv 上获取。

信源