产品功能
Gemini 推出智能体式视频理解
Google DeepMind 为 Gemini 3.7/3.6 Flash 与 3.5 Flash-Lite 带来智能…
2026.09.02 · 周三约 2 分钟阅读
Google DeepMind 在官方 X 账号宣布,Gemini 模型新增「智能体式视频理解」(agentic video understanding)能力。与过去对整段视频文件逐帧扫描不同,新版本会同时结合视频的转录文本、音频流和画面帧进行推理,并根据回答需要动态调整采样帧率,精准定位关键片段。
核心能力
Gemini 不再把视频当作需要逐帧读取的二进制文件,而是把它拆成三条互补的信息通道:
- 转录文本:捕捉人物对白与旁白,提供语义主线。
- 音频流:承载语气、背景声、音乐等转录难以覆盖的信息。
- 画面帧:保留视觉内容,供需要图像证据的问题使用。
模型会在推理过程中根据问题决定重点采样哪一条通道,并动态拉高或降低帧率,把「算力」集中到最相关的时间段。这一思路与近期业界推广的智能体(agentic)调用模式一致:先规划、再行动、最后整合答案。
适用模型与渠道
新功能已在 Google AI Studio 的 API 中开放,覆盖三款主打性价比的 Flash 系列模型:
- Gemini 3.7 Flash
- Gemini 3.6 Flash
- Gemini 3.5 Flash-Lite
Google 同时表示,智能体视频理解将在近期登陆 Gemini App,面向更广泛的普通用户。当前公告未给出 Pro 系列与更高规格模型的明确时间表。
效率与适用场景
官方强调,效率收益在长视频场景下最为明显,从 10 分钟的教程类内容到数小时的长讲座、播客或会议录像都能受益。原因在于:过去处理长视频需要消耗的 token 数会随时长线性甚至超线性增长,而动态采样 + 多通道推理让模型可以跳过大量冗余帧,仅在需要时调取细节,从而显著降低上下文开销与延迟。
对于依赖 Gemini 做视频摘要、内容检索、客服质检或媒体资产管理的开发者来说,这一更新意味着可以在不升级到 Pro 级别模型的前提下,用更低成本处理更长、更复杂的视频任务。
