桃子桃子快讯
返回首页
模型发布

谷歌推出 Gemini 3.5 Transcribe 语音转写模型

谷歌发布 Gemini 3.5 Transcribe 语音转文字模型,速度较前代提升约 70%,实时转写错误率降至 5.…

2026.08.27 · 周四2 分钟阅读

谷歌近日正式发布 Gemini 3.5 系列下的语音转写模型 Gemini 3.5 Transcribe,主打更快、更准的语音输入体验,并可在转写过程中自动去掉「嗯」「啊」以及口误修正等冗余内容,直接输出整理后的文本。该模型已率先用于 Pixel 11 的 Gboard「Rambler」功能,后续将逐步推广至谷歌生态中的更多产品。

核心改进:速度与准确率

根据谷歌官方数据,Gemini 3.5 Transcribe 在端到端转写速度上相较上一代语音引擎 Chirp 3 提升约 70%,从语音输入到最终成文的延迟明显缩短。准确率方面,新模型的实时语音转写错误率降至 5.5%,而 Chirp 3 的对应指标为 7.32%,相对改善约 1.82 个百分点。

虽然错误率的绝对降幅有限,但语音输入场景下用户难以回头逐字核对,Typo 的修复成本较高,因此速度与准确率的同步提升仍具有实际体验价值。

首个落地场景:Pixel 11 的 Gboard「Rambler」

Gemini 3.5 Transcribe 已经在 Pixel 11 的 Gboard 输入法中以「Rambler」功能的形式上线,允许用户进行长时间、连续的口语化输入,由模型在后台完成整理与转写。这是该模型首个面向消费者的落地形态,也被视为谷歌在大模型语音能力上的又一次产品化验证。

更广泛的生态部署

除了 Pixel 设备上的输入法,谷歌表示 Gemini 3.5 Transcribe 还将陆续接入谷歌生态中的更多产品与服务,覆盖语音转写、字幕生成、会议记录等典型场景。对于使用 Google Cloud 语音 API 的开发者而言,这一升级意味着可用更低延迟和更高准确率的语音识别能力来构建应用。

值得注意的是,在 Gemini 3.5 Transcribe 之外,外界仍在等待 Gemini 3.5 Pro 的正式发布。本次新模型的上线,也被视为谷歌在 3.5 系列分支上持续扩展能力边界的一个信号。

信源