模型发布
Google DeepMind 发布 Gemini 3.8 Flash TTS,强调可定制与可导演的语音生成
Google DeepMind 推出两款 TTS 新模型,支持自然语言创建音色、逐行导演对白与多人对话,覆盖 100 多…
2026.09.23 · 周三约 5 分钟阅读
Google DeepMind 宣布在 Gemini 家族中新增两款文本转语音模型——Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS,将语音生成从「预设音色库」升级为「可定制的动态创作工坊」。两款模型已在 Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook 与 Google Vids 中上线,面向创作者、开发者和企业用户提供更富表现力的音频生成能力。
两款模型的定位差异
- Gemini 3.8 Flash TTS:面向深度创意与角色设计的旗舰版本,支持用自然语言提示从零创建全新音色,可用于游戏、有声书、播客与互动媒体;并提供逐行的精细控制,包括表演提示、节奏、方言切换与「插话反应」等。
- Gemini 3.8 Flash-Lite TTS:面向高吞吐、成本敏感场景,主打大规模配音、音频内容生产与表现力语音代理,可在音色、节奏与情绪细节上进行细粒度调节。
两款模型加入此前的 Gemini Audio 阵营,与 3.5 Live Translate、3.5 Transcribe、3.8 Live 及 3.8 Live Extended Thinking 形成互补。
自定义音色:从 30 个预设到「无限库」
新版本将可用音色从 30 个扩展到 2000 多个生产级音色,并覆盖包括墨西哥西班牙语、魁北克法语、苏格兰英语在内的多种地区方言,整体支持超过 100 种语言与方言。核心能力包括:
- 生成式音色设计:用自然语言提示设定角色、口音与声音特征,例如创建一条「会喷火的龙」或带地域腔调的魅力旁白。
- 音色复刻:仅需 30 秒音频样本即可复刻声音,系统强制要求被复刻者的口头同意录音,并叠加 SynthID 水印与 C2PA 凭证以保护权益。
- 保存与扩展:用户可保存自定义音色并跨项目复用,减少长周期项目中的音色漂移。
- 音色再混合(即将上线):从音色库中选择起点,通过提示微调音色、音高、节奏与口音,例如「加入轻微的美国南部口音」或「让语气更柔和」。
逐行导演对白与长音频
两款 TTS 模型均提供精细的「逐行表演控制」能力,适合需要叙事张力的长内容场景:
- 支持自然语言脚本提示(如「冷静的客服」「低语悬疑场景」)来引导 Gemini 自主演绎。
- 可在数小时的连续音频中保持音色、节奏与人物特征稳定,降低长篇播客与有声书的漂移。
- 内置双人对话场景调度,从同一脚本生成自然的多轮对话,并保持两位说话人音色清晰区分。
- 支持脚本化的语气爆发与「插话反应」,例如
<laughs>、<sigh>、<gasp>以及|mhm|、|yeah|等拟声与主动倾听标记。
基准成绩与全球语言覆盖
根据官方披露:
- 在 Hume AI 的 Voice Design Benchmark 上,Gemini 3.8 Flash TTS 以 71.4 取得第一名,并在口音建模子项上以 60.8 领先。
- 在 Hume AI 的 Overall Quality Index 上,3.8 Flash TTS 与 Flash-Lite TTS 分列第一、第二;相比 Gemini 3.1 Flash TTS,在长内容生成与双人剧本控制等场景上有显著提升。
- 在 Voice Arena 的盲测人评中,两款模型在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语与印地语等关键全球语言上均位居前列。
安全、信任与透明机制
针对音色复刻与 AI 生成音频,Google DeepMind 强调多层防护:
- 同意核验:复刻声音前必须提交被复刻者的口头同意录音,并经系统核验与参考说话人匹配。
- SynthID 水印:所有 Gemini Audio 模型生成的音频均嵌入不可感知水印,便于识别 AI 生成内容、抑制虚假信息传播。
- 模型卡公开:团队发布模型卡,详细说明安全与责任机制。
用户可通过 Google AI Studio 的全新音频 Playground 试用这些能力,并基于自有脚本与音色库构建多语言语音产品。
