桃子桃子快讯
返回首页
模型发布

字节发布 Seed Audio 1.0:统一框架下的人声、音效与环境声联合生成

字节豆包团队推出音频创作模型 Seed Audio 1.0,支持时间线编排、参考音色和多语言,主观评测多项指标领先竞品。

2026.07.21 · 周二3 分钟阅读

字节跳动豆包团队近日推出 Seed Audio 1.0 音频创作模型,继豆包助手和 Seedance 视频模型之后,在多模态版图上再落一子。该模型面向完整声音场景,在统一框架下联合建模人声、音效和环境声等多种音频要素,端到端完成影视级音频创作。

模型核心能力

Seed Audio 1.0 目前可接受 3000 字以内的提示词,生成音频时长约 2 分钟,文本较长时语速会相应加快。其核心能力主要体现在三方面:

  • 一条 prompt 即可统一编排带特定情绪的对话、音效和背景音,并可按时间线精准设定声音出现的位置,给创作者更大的把控空间。
  • 支持参考音频输入,长音频、多场景内容可在不同段落间保持固定音色,同一音色也能自然呈现不同情绪和表达方式。
  • 支持 20 多种语言,便于配音、播客等音频工作流,低成本完成跨语言内容切换,对内容出海、游戏本地化、品牌广告等多语言需求场景具有实用价值。

官方主观评测结果

由于音频创作模型缺乏公开基准测试,字节采用主观评测方式与两个竞品对比:

  • 在文本生成音色能力方面,Seed Audio 1.0 得分高于两个竞品。
  • 生成音频可用率分别比竞品高出 35% 和 22.7%,高品质标准音频生成率比竞品高出 60% 以上。
  • 在影视、电视节目、短剧、动漫、播客对话、直播带货等多场景下,多数场景音频可用率已达到 90% 以上,但若以高品质为标准,多数场景生成概率降至 35% 以下。
  • 多语言自然度方面,除越南语外各语种得分均超过 4 分(5 分制);指令遵循上除越南语外也均超过 3.5 分。

实际体验与局限

Seed Audio 1.0 已对所有用户开放。实测场景包括科幻对话、脱口秀风格配音以及中英播客翻译。在参考音色加持下,单口相声类内容的节奏和情绪可达到可用水平;中英字幕替换测试中,模型能按时间线生成英文口播,但受时长限制部分语速偏快。作为对比,剪映的克隆音色仅支持在克隆基础上调整语速,后期空间有限且需消耗积分。

同时体验中也暴露了一些不足:

  • 部分场景的结尾背景音乐未能按提示生成,需要更精确的提示词或参考音频。
  • 涉及配乐的场景对普通用户门槛较高,乐器选择、情绪表达等需要专业知识或借助 AI 生成提示词。
  • 长篇音频的观众欢呼声等群体音效「AI 味」较浓,需要进一步精调。

Seed Audio 1.0 是字节在音频生成方向的 1.0 版本,结合其在 Seedance 视频模型上的快速迭代节奏,未来与视频模型、剪辑工具的联动空间值得持续关注。

信源