桃子桃子快讯
返回首页
产品功能

Google DeepMind 为 Gemini API 加入逐行语音调控与 SynthID 水印

Gemini API 新增可逐行调节语速、情感与停顿的语音生成能力,所有音频自动嵌入 SynthID 水印。

2026.09.23 · 周三2 分钟阅读

Google DeepMind 在官方 X 平台发文,介绍 Gemini API 语音生成能力的最新进展:开发者可对输出音频进行「逐行」(line by line) 级别的精细调控,覆盖语速、情感,以及笑声、停顿等口语化细节,旨在让 AI 合成的语音在节奏与表现力上更贴近真人播报。所有经此能力生成的音频,都将自动嵌入 SynthID 水印,以便在内容审核、版权追溯等场景下可靠识别其为 AI 生成内容。

逐行细粒度控制:聚焦节奏与情感

根据官方介绍,本次更新的核心卖点是把语音生成的控制粒度下沉到「逐行」级别。开发者可以在不同语句之间分别设置:

  • 语速(pacing):让关键信息放慢,铺垫段落提速;
  • 情感(emotion):在同一段音频中切换不同的语气倾向;
  • 口语化线索(cues):例如笑声、停顿等,进一步增强拟人度。

这种「按行调参」的思路,意味着同一段文本可以输出节奏差异明显的多个版本,便于在播客、有声读物、视频配音等场景中挑选最合适的呈现方式。

SynthID 水印:AI 语音的「身份证」

本次另一项值得关注的同步动作是,所有通过该能力生成的音频都会自动嵌入 SynthID 水印。SynthID 是 Google DeepMind 此前推出的内容标识体系,最早应用于图像与文本,如今扩展到音频领域。水印信息以人耳难以感知的方式嵌入波形,既不影响播放体验,又能在事后被专用工具检测出来,从而帮助平台与监管方判断一段音频是否由 AI 生成。

如何接入

开发者可通过 Google AI Studio 调用 Gemini API 来试用相关语音能力。原帖附带了详细介绍链接,供希望深入了解参数与调用方式的读者参考。需要注意的是,本次官方仅给出能力概述与接入入口,尚未披露具体的可调参数列表、模型版本号、支持的语种及定价等细节,更多技术规格仍待后续披露。

信源