桃子桃子快讯
返回首页
产品功能

Gemini 语音识别升级:支持复杂数字识别与 85+ 语言自动检测

Google DeepMind 更新 Gemini 语音识别能力,新增复杂号码识别、口头禅自动过滤、自定义词表与 85…

2026.08.27 · 周四2 分钟阅读

Google DeepMind 近日通过官方 X 账号宣布,对 Gemini 的语音识别(ASR)能力进行了一组功能升级,重点提升在真实使用场景下的转写准确率与可用性。更新已在 Gemini 桌面应用(macOS)、Android Gboard 键盘以及 Google AI Studio / Antigravity 平台同步上线,开发者与终端用户均可立即体验。

核心更新内容

本次更新围绕「听得更准、写得更快、认得更全」三个方向展开,具体包括:

  • 复杂号码识别增强:在嘈杂环境下,模型对电话号码、邮政编码、订单号等长串数字的识别准确率提升。
  • 口头禅自动过滤:可自动移除「嗯」「啊」「那个」等无意义填充词,并对文本进行格式化整理。
  • 自定义词表支持:允许用户添加品牌名、产品名、人名等专属词汇,使模型更好地识别专有名词。
  • 多语言自动检测:无需手动指定语种,模型可自动判断并转写 85 种以上语言的语音输入。

面向开发者与终端用户

面向普通消费者,本次升级随 Gemini macOS 客户端与 Android 平台 Gboard 同步推送,用户在日常语音输入场景即可受益;面向开发者,相关能力已在 Google AI Studio 与 Antigravity 开放,可在 API 与开发环境中调用,便于将语音能力集成到自有产品中。

行业意义

语音识别长期以来是 AI 应用层的刚需能力之一,但在「数字串识别」「噪声鲁棒性」「多语种自动切换」等真实场景上仍有明显痛点。Gemini 此轮更新聚焦这些工程化细节,意味着头部厂商正持续打磨 ASR 的「最后一公里」体验,而非单纯比拼底层模型规模。对于正在构建语音交互、智能客服、会议转写等应用的开发者而言,这是一次值得关注的能力升级。

信源