桃子桃子快讯
返回首页
产品功能

DeepMind 为 Gemini 引入智能体式视频理解,token 消耗最多降 88%

Google DeepMind 宣布最新 Gemini 模型支持智能体式视频理解,分析准确率提升的同时 token 消耗…

2026.09.02 · 周三1 分钟阅读

Google DeepMind 近日宣布,已为其最新 Gemini 模型引入智能体式(agentic)视频理解能力。根据官方在 X 平台发布的消息,相关模型在视频分析任务中准确率有所提升,同时 token 消耗最多可减少 88%。

核心更新:智能体式视频理解

DeepMind 在帖文中将这一能力描述为「agentic video understanding」。与传统被动式逐帧处理不同,智能体式视频理解允许模型在分析过程中自主调度资源、选择关注重点,以更接近人类注意力分配的方式处理长视频内容。官方强调,新方法在提升准确率的同时显著降低了 token 用量。

关键数据:token 消耗最高减少 88%

官方给出的核心指标是 token 使用量最高减少 88%。在多模态视频分析场景中,token 消耗与视频帧密度、采样策略直接相关,这一降幅意味着处理相同视频所需的推理成本将大幅压缩。对长视频摘要、视频问答、多模态 Agent 等任务而言,这一效率提升具有直接价值。

适用范围与后续信息

帖文将适用范围表述为「最新 Gemini 模型」,未在公开内容中指明具体型号。完整技术说明、benchmark 表现与接入方式需通过帖文附带的链接进一步查阅。开发者与产品团队可关注后续官方文档,以了解实际可调用的接口、定价及能力边界。

信源