FireRed团队开源两款音频模型:统一理解与生成、多语言TTS
FireRedTeam发布FireRedAudio(9B参数统一音频语言模型)与FireRedTTS3(支持24种语言、…
小红书 FireRedTeam 团队近日在 Hugging Face 上线两款开源音频模型——FireRedAudio 与 FireRedTTS3,前者定位为统一的音频理解与生成大模型,后者专注多语言、多方言的语音合成与编辑,两者均同步开源权重、GitHub 仓库、arXiv 论文与可交互 Demo。
FireRedAudio:首个公开的「解耦表示」统一音频语言模型
FireRedAudio 基于一个共享的 9B 参数大语言模型底座构建,采用「解耦的连续表示」设计:将 Audio Encoder 通路用于音频理解,RedAE-Patch 通路用于语音生成,两类表示在底层保持分离,但共享同一套语言与推理骨架。团队表示,这是首个公开披露的此类统一音频语言模型架构。
单个模型即可覆盖完整的音频任务栈,包括:
- ASR(自动语音识别)
- 通用与细粒度音频理解
- 零样本 TTS
- 指令式 TTS
- 语义/声学语音编辑
- 对最长约 1 小时的音频进行时间戳对齐与推理
在 MMAU、MMSU、Seed-TTS-Eval、InstructTTSEval、Ming-Freeform-Audio-Edit 等基准上,FireRedAudio 取得「具有竞争力或领先」的成绩。用户可通过自然语言完成声音克隆、声音设计、语音内容与风格的编辑。
FireRedTTS3:24 种语言与 21 种汉语方言
FireRedTTS3 基于「语义增强的连续语音表示」,提供两个变体:
- FireRedTTS3-Base:覆盖 24 种语言、21 种汉语方言的零样本声音克隆
- FireRedTTS3-Instruct:自然语言驱动的语音设计与统一编辑(语义+声学)
基准成绩方面,团队报告在 MiniMax-MLS-Test 上取得最佳平均 WER/CER 约 3.754%、最佳平均说话人相似度约 84.8%;在 Seed-TTS-eval 上克隆 WER/CER 约 3.04%、相似度约 78.8%。
24 种支持语言包括阿拉伯语、粤语、中文、捷克语、荷兰语、英语、芬兰语、法语、德语、希腊语、印地语、印尼语、意大利语、日语、韩语、波兰语、葡萄牙语、罗马尼亚语、俄语、西班牙语、泰语、土耳其语、乌克兰语、越南语。
21 种汉语方言覆盖安徽、福建、甘肃、贵州、河北、河南、湖北、湖南、江西、辽宁、闽南、宁夏、陕西、山东、上海、山西、四川、天津、温州、吴语、云南等主要方言区。
Instruct 变体支持从性别、年龄、音色、情感、语速、口音等自然语言描述生成全新声音,无需参考音频;同时支持自由形式的语音编辑,包括插入、删除、替换等语义操作与语速、音量、音高等声学操作。
FireRedTeam 的开源生态
除上述两款模型外,FireRedTeam 此前已开源或发表多项工作,包括:
- OpenStoryline:面向自主、人对齐视频创作的智能体框架
- FireRedChat:全自托管全双工语音交互方案
- FireRedASR:工业级开源 ASR 模型
- FireRedTTS-2:面向播客与聊天的长对话语音生成
- InstantID、InstantStyle、StoryMaker、LayerDiffuse-Flux 等图像生成相关项目
FireRedAudio 与 FireRedTTS3 的权重、推理代码与 Demo 已发布在 Hugging Face 和 GitHub,论文可在 arXiv 上获取。
