谷歌推出 Gemini 3.8 Flash TTS,主打声音设计与亲民定价
谷歌发布两款文本转语音模型,支持自然语言设计音色与30秒声音复刻,每小时音频最低约0.54美元。
谷歌于美国时间 9 月 23 日正式发布 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,将语音生成从「选声音」推向「设计声音」的方向。两款模型已在 Gemini API 与 Google AI Studio 上线,并接入 Gemini Notebook 与 Google Vids,企业级 API 也同步开放。值得关注的是,原 Hume AI 创始人、情感语音领域研究者艾伦·考恩(Alan Cowen)今年加入谷歌 DeepMind 担任研究科学总监,并参与领导了本次发布。
模型定位与核心能力
两款模型分工各有侧重。旗舰版 Gemini 3.8 Flash TTS 面向深度创意与角色设计,覆盖游戏、沉浸式有声书与播客等场景;轻量版 Gemini 3.8 Flash-Lite TTS 面向高并发与批量处理,主打长视频配音、音频内容创作与客服语音智能体。
在能力层面,新模型带来了几项关键变化:
- 自然语言生成声音(Generative Voice Design):用户无需预先录音,可通过自然语言描述角色年龄、口音与音色(例如「一个凌晨 2 点疲惫不堪、说英语带有浓重德语口音的柏林人」),由模型生成对应音色。
- 声音复刻(Voice Replication):基于约 30 秒参考音频提取声线特征进行复刻。
- 逐行剧本控制与非语言表达:可在文本脚本中添加舞台指导,并插入
<laughs>(笑声)、<sigh>(叹息)、<gasp>(喘息)以及|mhm|等回应词,模拟人类交谈中的停顿与语气起伏。 - 双人对话与长音频一致性:支持基于同一脚本生成双人交替对话,并对长音频连续生成中的声线漂移做了优化。
基准成绩与实际体验边界
谷歌公布的测试数据方面:
- 在 Hume AI 的 Voice Design Benchmark 中,Flash TTS 综合得分 71.4,口音建模维度得分 60.8。
- 在 Hume AI 综合质量指数(Overall Quality Index)中,Flash TTS 与 Flash-Lite TTS 分列前两位。
- 在 Voice Arena 的双盲偏好测试中,两款模型在日语、现代标准阿拉伯语、墨西哥西班牙语、印地语等多个语种中获得了较高胜率。
不过,基准成绩并未完全等同于生产环境表现。科技媒体 Unfiltered AI 测评指出,模型在部分高频段音频中仍能观察到微小的合成杂音;在极端长文本连续渲染后期,少数样例出现了轻微的声线漂移。谷歌发布的 Model Card 同样承认,新模型仍可能出现偏离文本、发音异常等问题,并在高负载下可能产生响应延迟或超时。
定价策略:每小时最低 0.54 美元
价格是本次发布的另一重点。2026 年底前开发者可享受优惠 API 价格:
- Flash TTS:文本输入 0.50 美元 / 百万 Token,音频输出 9.00 美元 / 百万 Token。
- Flash-Lite TTS:文本输入 0.50 美元 / 百万 Token,音频输出 6.00 美元 / 百万 Token。
按谷歌给出的折算方式(1 秒生成音频约等于 25 个音频 Token),连续生成 1 小时音频的纯输出 API 费用约为:Flash TTS 0.81 美元,Flash-Lite TTS 0.54 美元(折合人民币约 3.8 元)。即便 2027 年价格恢复至 Flash TTS 18 美元 / 百万 Token、Flash-Lite TTS 12 美元 / 百万 Token,1 小时音频费用仍处于较低水平。需要注意的是,上述费用仅指音频输出 Token 的理论折算,未计入额外开销。
生态布局与安全防护
在分发层面,开发者与企业可通过 Gemini API、Google AI Studio 调用;终端与办公场景中,Flash TTS 集成至 Gemini Notebook,Flash-Lite TTS 内置于 Google Vids。TTS 的竞争因此从单点音质延伸到 API 与办公产品生态。
随着声音复刻所需样本缩短至 30 秒左右,授权与版权问题成为行业课题。谷歌为此设置了多重防护:
- 知情同意机制:复刻前需被复刻者录制口头授权录音,系统进行声纹比对后方可生成。
- 数字水印与追溯:所有 Gemini Audio 生成的音频均织入 SynthID 音频水印,并附带 C2PA 数字凭证。
- 地区限制:美国伊利诺伊州、得克萨斯州、欧洲经济区、英国、瑞士与印度等地区暂不开放声音复刻功能。
