产品功能
Google 推出 Gemini 3.8 Flash TTS 系列,主打语音设计与双人对白控制
Google 在 AI Studio 与 API 中上线 Gemini 3.8 Flash TTS 与 Flash-Li…
2026.09.23 · 周三约 2 分钟阅读
Google 近日在 AI Studio 与 API 中上线了 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音合成模型,重点强化"语音设计(Voice Design)"与"双人对白(dual-speaker screenplay)"两类能力。这是 Gemini Flash 系列首次以 3.8 版本号出现在 TTS 场景中,被官方描述为目前"最具表现力的音频生成模型"。
核心能力:自定义人声与逐行对白
新模型的核心卖点集中在可控性上,主要包含三项能力:
- 自定义人声角色:通过 Prompt 提示词直接设定说话人的音色、年龄、语气等属性。
- 逐行对白控制:支持对脚本中每一行单独指定说话人,实现更精细的剧本化朗读。
- 拟声插入(vocal bursts):可在生成音频中插入叹气、笑声等自然人声片段,提升表现力。
官方将 Gemini 3.8 Flash TTS 定位为"旗舰级 TTS 模型",而 Flash-Lite 版本则面向更轻量、成本更敏感的应用场景。
使用方式与可用渠道
两款模型已可通过 Google AI Studio 与 Gemini API 直接调用,开发者无需额外申请或配置即可在现有项目中替换旧版本 TTS。Google 尚未公布具体的定价、字符上限、支持的语种数量与音频格式等细节。
行业意义
语音合成一直是多模态 AI 的重要分支。Google 此次将"人声设计 + 剧本级对白控制"作为主要卖点,意味着 TTS 正从单纯的"读稿"能力,向更接近专业配音与有声内容生产的方向演进。对于有声书、播客、视频配音、游戏 NPC 等场景,开发者将获得更细颗粒度的声音控制能力。不过,目前公开信息中尚无 benchmark 数据或与 ElevenLabs 等竞品的横向对比,性能表现仍需进一步验证。
