Google DeepMind 发布 Gemini 3.7 Flash:编程与 Agent 能力再升级
Google DeepMind 发布 Gemini 3.7 Flash,主打编程与 Agent 任务,多项基准较 3.6…
Google DeepMind 于 8 月 13 日正式推出 Gemini 3.7 Flash,定位为「迄今最聪明的劳模型」,面向编程与智能体(Agent)场景。这是继 Gemini 3.6 Flash 之后仅三周内推出的又一次更新,官方称其在软件工程、知识工作与 Web 开发工作流上均带来实质性提升,并将入门定价降至 3.6 Flash 原价的一半。
核心升级:面向编程与 Agent 的智能化
3.7 Flash 在代码相关任务上相比 3.6 Flash 取得明显进步,调试(debugging)与问题修复(issue resolution)表现尤为突出。在一次性代码准确率上,模型能更高概率生成可投产级别的代码,减少开发者多轮修改的成本。在 Agent 工作流中,这种提升意味着更可靠的多步骤执行与更少的循环重试。
Web 开发与 UI 生成能力增强
在 Web 开发场景下,3.7 Flash 能在更少的提示轮次内生成功能更完整、布局更可用的应用页面。无论是依据截图、参考图,还是完整的设计系统(design system),模型在 UI 生成中都表现出更高的设计遵循度与还原一致性。
官方给出了以下关键基准对比:
- FrontierCode 1.1 Main:3.7 Flash 得分 43.6%,3.6 Flash 为 34.4%。
- DeepSWE v1.1:3.7 Flash 得分 65.3%,3.6 Flash 为 49.0%。
- Arena.ai WebDev Arena Elo:3.7 Flash 达到 1588,3.6 Flash 为 1538。
定价与开发者反馈驱动
3.7 Flash 的入门定价为每百万 token 价格为 3.6 Flash 原始定价的一半,意在降低高频率、高吞吐量调用场景下的使用门槛。官方表示,本次版本的快速迭代直接来源于开发者社区反馈以及算法层面的创新,这些方法后续也将被引入未来的模型版本中。
面向知识密集型工作的延伸
除编程与 Web 开发外,3.7 Flash 在金融、法律等知识密集型领域也有所增强,具体表现有待更多第三方基准披露。该版本继续延续 Flash 系列「轻量、便宜、可大规模部署」的定位,同时显著提升复杂任务下的智能水平,是开发者构建 AI Agent 与自动化工作流时值得关注的一次能力升级。
