桃子桃子快讯
返回首页
产品功能

Google DeepMind 推出两款 Gemini TTS 模型,支持自定义语音

Google DeepMind 发布 Gemini Flash 与 Flash-Lite 两款 TTS 模型,支持自定义…

2026.09.23 · 周三2 分钟阅读

Google DeepMind 近日在 X 平台公布了两款新的文本转语音(TTS)模型,进一步扩展其 Gemini 系列在语音生成方向上的产品线。两款模型分别定位个性化创作与大规模高效率部署,覆盖不同应用场景。

两款模型定位差异明显

此次发布的两款 TTS 模型均隶属 Gemini 系列:

  • Gemini Flash TTS:面向需要个性化语音设计的用户,支持为角色创建具有独特口音与声音特征的自定义音色,适合内容创作、虚拟角色配音等场景。
  • Gemini Flash-Lite TTS:主打高效率与可扩展性,开发者既可使用自己创建的语音风格,也可从官方提供的「production-ready」生产级音色库中选择,更适合大规模集成与产品化部署。

应用场景与生态意义

文本转语音模型近年来已成为生成式 AI 的重要分支之一,被广泛应用于有声内容生产、辅助阅读、客服语音交互、智能助手等场景。DeepMind 将 TTS 能力拆分为「创作型」与「效率型」两条产品线,意在同时满足创作者与开发者的差异化需求:

  • 自定义音色能力降低了内容创作者对第三方配音的依赖。
  • 内置音色库与轻量化模型变体则便于企业用户在成本可控的前提下快速上线语音功能。

信息尚待补全

截至目前,Google DeepMind 在 X 上的官方帖文仅披露了产品名称与定位描述,尚未公布具体的定价、上下文长度、延迟表现、支持语言数量、可用区域以及 API 接入方式等技术细节。开发者与企业在评估落地可行性前,仍需等待后续的完整文档与定价信息发布。

总体来看,本次更新是 Gemini 系列产品矩阵的常规扩展,体现出 DeepMind 在多模态语音生成方向持续投入的意图。两条产品线的差异化定位,有望为不同体量的用户提供更贴合需求的语音解决方案。

信源