桃子桃子快讯
返回首页
产品功能

Google 发布 Gemini 3.5 Transcribe 语音转写模型

Google DeepMind 推出专用的语音转写模型,支持实时流式与离线处理,词错率显著优于前代 Chirp 3。

2026.08.27 · 周四5 分钟阅读

Google DeepMind 于 8 月 26 日发布 Gemini 3.5 Transcribe,这是一款专为其语音交互场景设计的语音转写(speech-to-text)模型。与传统语音识别模型不同,3.5 Transcribe 能够直接将原始音频转换为准确、经过润色且格式规整的文本,在背景噪音、专业术语与口语修正处理上均有针对性优化。

此前,该模型已在 Gemini App 与 Android 等消费端产品中落地,包括 Android 上的 Rambler 语音输入功能以及 macOS 版 Gemini App 的语音能力。此次更新后,开发者可通过 Gemini API(Google AI Studio)和 Gemini Enterprise Agent Platform 调用该模型,自主构建语音类应用。

两类 API 接入方式

模型按使用场景拆分为两个独立 API 接口:

  • 实时流式转写(gemini-3.5-transcribe-live):通过 Live API 提供双向流式传输,延迟低于一秒,适用于交互式语音应用。
  • 预录音频处理(gemini-3.5-transcribe):通过 Interactions API 处理会议录音、通话记录等离线音频,支持说话人归属与单词级时间戳。

关键能力与技术指标

3.5 Transcribe 的设计目标是捕捉自然口语风格、理解说话人意图并识别自定义词汇,从而支持以语音驱动的复杂任务执行。其核心能力包括:

  • 智能转写:自动处理自我修正(如「星期二……不对,星期三」)、去除「um」「ah」等口头禅,并对文本进行自动格式化。
  • 函数调用:可在 macOS 版 Gemini App 中通过 function call 委托图像生成、文件分析等任务给其他 Gemini 模型。
  • 精度提升:据 Artificial Analysis 评测,实时流式场景平均词错率(WER)为 4.0%,离线场景为 2.6%;在噪声环境与邮政编码、订单号等字母数字混合实体上表现稳定。
  • 自定义词汇:可适配用户提供的专业术语与特殊拼写。
  • 多语言支持:自动识别并转写超过 85 种语言,覆盖不同地区口音与方言。
  • 多说话人识别:离线音频中可对最多 3 位说话人进行归属标注(3 人以上为实验性)。

相比前代 Chirp 3,3.5 Transcribe 的最终转写完成时间缩短了 70%。在 FLEURS 多语言基准测试中,其流式模式 WER 为 5.50%,离线模式为 5.04%,均较 Chirp 3 有明显提升。

跨 Google 产品矩阵的落地

除面向开发者的 API 外,3.5 Transcribe 也被嵌入到 Google 自家的多款应用与系统层:

  • Gboard(Android):通过 Rambler 功能将语音想法转化为格式化文本,并支持通过语音进行编辑、纠错与改写风格。
  • Google Antigravity:结合屏幕上下文与对话历史(需用户授权),提升文件名、Agent 思考过程与活动文档的转写准确性。
  • Google AI Studio:Build 模式下可通过语音「氛围编程」(vibe code)实时构建应用。
  • Gemini App(macOS):除基础转写外,可借助屏幕上下文,通过语音指令触发对本地文件的总结、跨应用文本改写或图像生成。
  • Chrome(即将上线):将在任意网页输入框中支持语音输入,便于回复、发帖或与 Chrome 内 Gemini 对话。

生态合作与早期反馈

基于 Gemini Live API,Agora、FishJam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents 等开发平台已陆续接入,方便开发者构建低延迟语音交互界面。Vivo、Intellitek Health、Lingopal 等企业也对 3.5 Transcribe 的延迟、准确率与多语言覆盖给出了正面评价。

开发者现可通过 Google AI Studio 中的 Gemini API 试用 Gemini 3.5 Transcribe,企业用户可在 Gemini Enterprise Agent Platform 中接入该模型。

信源