AI 语音公司 Fish Audio 获 5000 万美元种子轮融资
前英伟达研究员创立的 Fish Audio 已积累 800 万用户与 2100 万美元年经常性收入,本轮融资将用于开发更…
AI 语音生成初创公司 Fish Audio 近日宣布完成 5000 万美元种子轮融资,由 Coreline Ventures 与 Capital Today 领投,359 Capital、Parable、Play Time、Alphalist Partners、Bayhouse Ventures、Carya Venture Partners 与 HF0 参投。融资公布于公司产品线快速扩张、商业化加速推进之际。
公司背景与增长数据
Fish Audio 总部位于帕洛阿尔托,由前英伟达研究员 Shijia Liao 创立。Liao 早期因不满市面合成语音缺乏表现力,在单卡 GPU 上训练了一个语音生成模型并将其开源,该项目即如今 GitHub 上拥有超过 3.1 万星标的 Fish Speech 仓库。
公司目前已覆盖超过 15000 项自然语言控制能力,开源版本与托管版本合计用户超过 800 万,年经常性收入(ARR)达到 2100 万美元。过去一年中,Fish Audio 已发布五款模型,包括四款语音生成模型与一款语音转文字模型,其中三款语音生成模型已开源,最新的 S2.1 Pro 仅通过付费 API 提供。
商业模式与客户结构
Fish Audio 的产品矩阵同时面向创作者与企业用户:
- 面向个人与团队的订阅计划:按月付费,包含一定时长的语音生成额度与声音克隆功能。
- 面向企业的 API 与平台版本:已服务 HeyGen、Sanas、Plaud 等客户。
CEO Rissa Cao 表示,不同客户对语音的需求差异显著——AI 数字人公司 HeyGen 看重真实感,游戏工作室需要角色表现力,而 LiveKit 等语音智能体厂商则要求低延迟与自然对话感。
版权争议与社区机制
Fish Audio 的声音库部分来源于用户自愿提交并获得报酬的语音数据,但此前曾有创作者指控其声音在未经同意的情况下被上传。公司此前依赖 DMCA 下架流程处理投诉,响应周期较长。Cao 表示,下架流程现已自动化,创作者提交短样本或合同后,约 3 分钟内即可完成下架。但该机制仍属事后处置,无法主动阻止未授权上传。
Coreline Ventures 合伙人 Oskue Honda 强调,社区驱动模式能否持续取决于信任,「consent、transparency、attribution 必须内嵌进产品,而不是事后补丁」,并呼吁行业建立声音产权验证、清晰授权与收益分成机制。
竞争格局与未来规划
语音生成赛道竞争激烈,ElevenLabs、WellSaid、Cartesia、Speechify、Async(前 Podcastle)、Krisp 等公司均在争夺创作者与企业客户。359 Capital 合伙人 Rico Mallozzi 认为,Fish Audio 在团队规模有限的情况下仍构建出业界领先模型,体现了技术实力,未来精细化控制能力与成本效率将是其差异化竞争关键。
公司表示,本轮资金将用于开发更先进的模型。今年计划推出一款音频理解模型,并正在构建一款语音到语音(speech-to-speech)模型。
