桃子桃子快讯
返回首页
产品功能

Google 推出 Gemini 3.8 Flash TTS 系列,主打语音设计与双人对白控制

Google 在 AI Studio 与 API 中上线 Gemini 3.8 Flash TTS 与 Flash-Li…

2026.09.23 · 周三2 分钟阅读

Google 近日在 AI Studio 与 API 中上线了 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音合成模型,重点强化"语音设计(Voice Design)"与"双人对白(dual-speaker screenplay)"两类能力。这是 Gemini Flash 系列首次以 3.8 版本号出现在 TTS 场景中,被官方描述为目前"最具表现力的音频生成模型"。

核心能力:自定义人声与逐行对白

新模型的核心卖点集中在可控性上,主要包含三项能力:

  • 自定义人声角色:通过 Prompt 提示词直接设定说话人的音色、年龄、语气等属性。
  • 逐行对白控制:支持对脚本中每一行单独指定说话人,实现更精细的剧本化朗读。
  • 拟声插入(vocal bursts):可在生成音频中插入叹气、笑声等自然人声片段,提升表现力。

官方将 Gemini 3.8 Flash TTS 定位为"旗舰级 TTS 模型",而 Flash-Lite 版本则面向更轻量、成本更敏感的应用场景。

使用方式与可用渠道

两款模型已可通过 Google AI Studio 与 Gemini API 直接调用,开发者无需额外申请或配置即可在现有项目中替换旧版本 TTS。Google 尚未公布具体的定价、字符上限、支持的语种数量与音频格式等细节。

行业意义

语音合成一直是多模态 AI 的重要分支。Google 此次将"人声设计 + 剧本级对白控制"作为主要卖点,意味着 TTS 正从单纯的"读稿"能力,向更接近专业配音与有声内容生产的方向演进。对于有声书、播客、视频配音、游戏 NPC 等场景,开发者将获得更细颗粒度的声音控制能力。不过,目前公开信息中尚无 benchmark 数据或与 ElevenLabs 等竞品的横向对比,性能表现仍需进一步验证。

信源