桃子桃子快讯
返回首页
模型发布

谷歌推出 Gemini 3.8 Flash TTS,主打声音设计与亲民定价

谷歌发布两款文本转语音模型,支持自然语言设计音色与30秒声音复刻,每小时音频最低约0.54美元。

2026.09.24 · 周四5 分钟阅读

谷歌于美国时间 9 月 23 日正式发布 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,将语音生成从「选声音」推向「设计声音」的方向。两款模型已在 Gemini API 与 Google AI Studio 上线,并接入 Gemini Notebook 与 Google Vids,企业级 API 也同步开放。值得关注的是,原 Hume AI 创始人、情感语音领域研究者艾伦·考恩(Alan Cowen)今年加入谷歌 DeepMind 担任研究科学总监,并参与领导了本次发布。

模型定位与核心能力

两款模型分工各有侧重。旗舰版 Gemini 3.8 Flash TTS 面向深度创意与角色设计,覆盖游戏、沉浸式有声书与播客等场景;轻量版 Gemini 3.8 Flash-Lite TTS 面向高并发与批量处理,主打长视频配音、音频内容创作与客服语音智能体。

在能力层面,新模型带来了几项关键变化:

  • 自然语言生成声音(Generative Voice Design):用户无需预先录音,可通过自然语言描述角色年龄、口音与音色(例如「一个凌晨 2 点疲惫不堪、说英语带有浓重德语口音的柏林人」),由模型生成对应音色。
  • 声音复刻(Voice Replication):基于约 30 秒参考音频提取声线特征进行复刻。
  • 逐行剧本控制与非语言表达:可在文本脚本中添加舞台指导,并插入 <laughs>(笑声)、<sigh>(叹息)、<gasp>(喘息)以及 |mhm| 等回应词,模拟人类交谈中的停顿与语气起伏。
  • 双人对话与长音频一致性:支持基于同一脚本生成双人交替对话,并对长音频连续生成中的声线漂移做了优化。

基准成绩与实际体验边界

谷歌公布的测试数据方面:

  • 在 Hume AI 的 Voice Design Benchmark 中,Flash TTS 综合得分 71.4,口音建模维度得分 60.8。
  • 在 Hume AI 综合质量指数(Overall Quality Index)中,Flash TTS 与 Flash-Lite TTS 分列前两位。
  • 在 Voice Arena 的双盲偏好测试中,两款模型在日语、现代标准阿拉伯语、墨西哥西班牙语、印地语等多个语种中获得了较高胜率。

不过,基准成绩并未完全等同于生产环境表现。科技媒体 Unfiltered AI 测评指出,模型在部分高频段音频中仍能观察到微小的合成杂音;在极端长文本连续渲染后期,少数样例出现了轻微的声线漂移。谷歌发布的 Model Card 同样承认,新模型仍可能出现偏离文本、发音异常等问题,并在高负载下可能产生响应延迟或超时。

定价策略:每小时最低 0.54 美元

价格是本次发布的另一重点。2026 年底前开发者可享受优惠 API 价格:

  • Flash TTS:文本输入 0.50 美元 / 百万 Token,音频输出 9.00 美元 / 百万 Token。
  • Flash-Lite TTS:文本输入 0.50 美元 / 百万 Token,音频输出 6.00 美元 / 百万 Token。

按谷歌给出的折算方式(1 秒生成音频约等于 25 个音频 Token),连续生成 1 小时音频的纯输出 API 费用约为:Flash TTS 0.81 美元,Flash-Lite TTS 0.54 美元(折合人民币约 3.8 元)。即便 2027 年价格恢复至 Flash TTS 18 美元 / 百万 Token、Flash-Lite TTS 12 美元 / 百万 Token,1 小时音频费用仍处于较低水平。需要注意的是,上述费用仅指音频输出 Token 的理论折算,未计入额外开销。

生态布局与安全防护

在分发层面,开发者与企业可通过 Gemini API、Google AI Studio 调用;终端与办公场景中,Flash TTS 集成至 Gemini Notebook,Flash-Lite TTS 内置于 Google Vids。TTS 的竞争因此从单点音质延伸到 API 与办公产品生态。

随着声音复刻所需样本缩短至 30 秒左右,授权与版权问题成为行业课题。谷歌为此设置了多重防护:

  • 知情同意机制:复刻前需被复刻者录制口头授权录音,系统进行声纹比对后方可生成。
  • 数字水印与追溯:所有 Gemini Audio 生成的音频均织入 SynthID 音频水印,并附带 C2PA 数字凭证。
  • 地区限制:美国伊利诺伊州、得克萨斯州、欧洲经济区、英国、瑞士与印度等地区暂不开放声音复刻功能。
信源