桃子桃子快讯
返回首页
产品功能

谷歌发布 Gemini 3.5 Transcribe,主打「理解式」语音转写

谷歌推出语音转文本模型 Gemini 3.5 Transcribe,可识别自我修正、删除口头禅,将口语直接转为格式化文本…

2026.08.27 · 周四3 分钟阅读

当地时间 8 月 26 日,谷歌正式发布语音转文本模型 Gemini 3.5 Transcribe。与传统语音识别工具相比,该模型不仅追求更高的识别准确率,更将能力边界从「逐字记录」延伸至「理解说话人意图并自动整理输出结果」,标志着语音识别技术开始向更深层的语言理解迈进。谷歌将其定位为迄今「最精准」的语音转文本模型,并已同步落地 Android 版 Gboard 与 Mac 版 Gemini 应用,同时通过 Gemini API 向开发者开放预览。此次发布与 Gemini 3.5 Live 及 Gemini 3.5 Live Experimental 同日推出,共同构成谷歌新的 Gemini Audio 系列。

从「逐字记录」到「意图理解」

Gemini 3.5 Transcribe 的核心升级在于对自然语言语境的理解能力。模型能够在转录过程中「读懂」说话人意图,并对原始语音进行编辑式处理。

  • 自我修正识别:当用户说出「周二——不,周三见面」时,模型会判定后者为修正后的最终意图,而非同时记录两种表述。
  • 口头禅过滤:自动删除「um」「uh」等无意义填充词。
  • 格式化输出:直接完成标点符号添加和段落整理,把凌乱的口述内容转化为格式化文本。

多语言与自定义能力

在语言支持层面,Gemini 3.5 Transcribe 覆盖超过 85 种语言,具备自动语种识别能力,并可处理多语言混说场景。

  • 支持添加自定义词汇,以更准确地识别专业术语、特殊拼写以及订单号、邮编等字母数字组合。
  • 对预录音频支持说话人识别(speaker diarization)和逐词时间戳,便于后期编辑与校对。

开发者接口与产品落地

在能力开放层面,Gemini 3.5 Transcribe 已通过 Gemini API 进入预览阶段,同时支持实时语音流与录制音频文件两种处理场景。据谷歌官方文档,文件转录最长支持 1 小时,实时转录则面向低延迟应用。开发者可调用低延迟转录、自定义词汇与智能格式化等能力,将语音识别嵌入自有应用。

在产品端,模型已落地 Android 平台 Gboard Rambler 语音输入功能与 Mac 版 Gemini 应用。谷歌还计划将其引入 Chrome 浏览器,未来用户可在网页文本框内直接通过语音回复消息、撰写帖子或向 Gemini 发出指令。

语音入口的战略意义

此次更新是其系统性推进 Gemini「语音入口」战略的一部分。Gemini 3.5 Transcribe、Gemini 3.5 Live 与 Gemini 3.5 Live Experimental 共同构成 Gemini Audio 系列,覆盖实时对话、语音翻译与语音输入等场景。

从商业视角看,语音转文本正从后台基础能力演变为 AI 应用的重要交互入口。随着模型具备「听懂—理解—整理—执行」的一体化能力,用户与 AI 的交互方式有望由键盘输入向语音指令迁移。对谷歌而言,将 Gemini 3.5 Transcribe 嵌入 Chrome、Gboard、Docs、Gmail 等高频产品,有助于在语音交互这一新兴入口上巩固其竞争位置。截至发稿,谷歌股价周四盘中下跌 1.37%。

信源