桃子桃子快讯
返回首页
模型发布

Google DeepMind 发布 Gemini 3.8 Flash TTS,强调可定制与可导演的语音生成

Google DeepMind 推出两款 TTS 新模型,支持自然语言创建音色、逐行导演对白与多人对话,覆盖 100 多…

2026.09.23 · 周三5 分钟阅读

Google DeepMind 宣布在 Gemini 家族中新增两款文本转语音模型——Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS,将语音生成从「预设音色库」升级为「可定制的动态创作工坊」。两款模型已在 Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook 与 Google Vids 中上线,面向创作者、开发者和企业用户提供更富表现力的音频生成能力。

两款模型的定位差异

  • Gemini 3.8 Flash TTS:面向深度创意与角色设计的旗舰版本,支持用自然语言提示从零创建全新音色,可用于游戏、有声书、播客与互动媒体;并提供逐行的精细控制,包括表演提示、节奏、方言切换与「插话反应」等。
  • Gemini 3.8 Flash-Lite TTS:面向高吞吐、成本敏感场景,主打大规模配音、音频内容生产与表现力语音代理,可在音色、节奏与情绪细节上进行细粒度调节。

两款模型加入此前的 Gemini Audio 阵营,与 3.5 Live Translate、3.5 Transcribe、3.8 Live 及 3.8 Live Extended Thinking 形成互补。

自定义音色:从 30 个预设到「无限库」

新版本将可用音色从 30 个扩展到 2000 多个生产级音色,并覆盖包括墨西哥西班牙语、魁北克法语、苏格兰英语在内的多种地区方言,整体支持超过 100 种语言与方言。核心能力包括:

  • 生成式音色设计:用自然语言提示设定角色、口音与声音特征,例如创建一条「会喷火的龙」或带地域腔调的魅力旁白。
  • 音色复刻:仅需 30 秒音频样本即可复刻声音,系统强制要求被复刻者的口头同意录音,并叠加 SynthID 水印与 C2PA 凭证以保护权益。
  • 保存与扩展:用户可保存自定义音色并跨项目复用,减少长周期项目中的音色漂移。
  • 音色再混合(即将上线):从音色库中选择起点,通过提示微调音色、音高、节奏与口音,例如「加入轻微的美国南部口音」或「让语气更柔和」。

逐行导演对白与长音频

两款 TTS 模型均提供精细的「逐行表演控制」能力,适合需要叙事张力的长内容场景:

  • 支持自然语言脚本提示(如「冷静的客服」「低语悬疑场景」)来引导 Gemini 自主演绎。
  • 可在数小时的连续音频中保持音色、节奏与人物特征稳定,降低长篇播客与有声书的漂移。
  • 内置双人对话场景调度,从同一脚本生成自然的多轮对话,并保持两位说话人音色清晰区分。
  • 支持脚本化的语气爆发与「插话反应」,例如 <laughs><sigh><gasp> 以及 |mhm||yeah| 等拟声与主动倾听标记。

基准成绩与全球语言覆盖

根据官方披露:

  • 在 Hume AI 的 Voice Design Benchmark 上,Gemini 3.8 Flash TTS 以 71.4 取得第一名,并在口音建模子项上以 60.8 领先。
  • 在 Hume AI 的 Overall Quality Index 上,3.8 Flash TTS 与 Flash-Lite TTS 分列第一、第二;相比 Gemini 3.1 Flash TTS,在长内容生成与双人剧本控制等场景上有显著提升。
  • 在 Voice Arena 的盲测人评中,两款模型在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语与印地语等关键全球语言上均位居前列。

安全、信任与透明机制

针对音色复刻与 AI 生成音频,Google DeepMind 强调多层防护:

  • 同意核验:复刻声音前必须提交被复刻者的口头同意录音,并经系统核验与参考说话人匹配。
  • SynthID 水印:所有 Gemini Audio 模型生成的音频均嵌入不可感知水印,便于识别 AI 生成内容、抑制虚假信息传播。
  • 模型卡公开:团队发布模型卡,详细说明安全与责任机制。

用户可通过 Google AI Studio 的全新音频 Playground 试用这些能力,并基于自有脚本与音色库构建多语言语音产品。

信源