桃子桃子快讯
返回首页
产品功能

Google 推出 Gemini 3.5 转写模型,支持 85 种语言自动识别专业术语

Google 更新 Gemini Audio,发布 3.5 Live、3.5 Live Experimental 及全新…

2026.08.27 · 周四2 分钟阅读

Google 近日更新了 Gemini Audio,推出 Gemini 3.5 Live、3.5 Live Experimental 以及全新成员 Gemini 3.5 Transcribe 三款音频模型,重点强化语音转写能力。新版本在精度与抗干扰方面做了改进,旨在为 Google 语音控制类 AI 功能提供更可靠的底层支持。

核心能力升级

Gemini 3.5 Transcribe 是本次新加入的模型,专门面向高精度转写场景。据 Google 介绍,新模型具备以下能力:

  • 自动识别并正确转写专业术语与行业 jargon;
  • 支持超过 85 种语言的转写;
  • 在背景噪音或语音被打断的情况下,仍能保持转写稳定。

配套发布的 Gemini 3.5 Live 与 3.5 Live Experimental 则面向实时语音交互场景,进一步提升对话流畅度与抗噪表现。

缺席的 Gemini 3.5 Pro

值得注意的是,Gemini 3.5 Transcribe 的发布恰逢外界持续关注 Gemini 3.5 Pro 的进度。Google 此前承诺该模型将在 6 月推出,但截至目前仍未正式发布。Google 选择先以转写与语音模型扩充产品线,被视为在主力大模型空窗期保持 Gemini 生态活跃度的策略。

对开发者的意义

对于依赖 Google 语音 AI 的开发者与产品团队而言,新模型提供了更细粒度的选择:实时对话可用 3.5 Live 系列,批量化或高精度转写则可调用 3.5 Transcribe。多语言与术语识别能力的提升,也使其在会议记录、客服质检、媒体字幕等场景下具备更直接的落地价值。

信源