Google 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber
DeepMind 推出三款面向智能体场景的 Gemini 模型,主打更高 token 效率与更低延迟,并预告 Gemin…
Google DeepMind 在官方博客中一次性推出三款 Gemini 新模型:面向主流工作负载的 Gemini 3.6 Flash、强调极致速度与性价比的 Gemini 3.5 Flash-Lite,以及专为网络安全场景打造的 Gemini 3.5 Flash Cyber(与 CodeMender 智能体配合使用)。DeepMind 同时确认,3.5 Pro 正在与合作伙伴测试中,下一代 Gemini 4 的预训练已启动。
Gemini 3.6 Flash:成本更低、质量更高的主力模型
3.6 Flash 定位为 Flash 系列的「主力」模型,重点优化智能体工作流中的 token 效率与延迟。DeepMind 引用 Artificial Analysis Index 的数据称,相比 3.5 Flash,其输出 token 使用量减少 17%,在部分基准(如 Datacurve 的 DeepSWE)上甚至最高减少 65%,且单 token 成本进一步下降。
定价方面,3.6 Flash 为每百万输入 token 1.50 美元、每百万输出 token 7.50 美元,在保持更低价格的同时带来多项能力提升:
- DeepSWE 代码编辑精度从 37% 提升至 49%。
- MLE Bench(机器学习研究)从 49.7% 提升至 63.9%。
- OSWorld-Verified 计算机使用从 78.4% 提升至 83.0%,并已作为内置客户端工具接入 Gemini API 与 Gemini Enterprise。
- GDPval-AA v2 知识工作评测从 1349 提升至 1421,Hebbia、Harvey 等客户反馈其在文档解析、图表分析与报告撰写等任务上表现突出。
DeepMind 还强调,3.6 Flash 在化学、生物、放射、核(CBRN)以及网络攻击等高风险领域启用了更强的 Frontier Safety 防护,并降低了对有益用途的过度拒答率。
Gemini 3.5 Flash-Lite:为高吞吐场景而生
3.5 Flash-Lite 主打低延迟与高吞吐,适合需要大规模并发处理的智能体搜索与文档处理场景。Artificial Analysis 测得其输出速度达每秒 350 tokens,为 3.5 系列最快;定价为每百万输入 token 0.3 美元、输出 token 2.5 美元。
相比 3.1 Flash-Lite,新版本在多个维度显著提升:
- Terminal-Bench 2.1 代码任务:54% vs 31%。
- GDM-MRCR v2 长上下文:72.2% vs 60.1%。
- GDPval-AA v2 真实任务:1140 vs 642。
在 SWE-Bench Pro(54.2% vs 49.6%)与 OSWorld-Verified(74.0% vs 65.1%)等智能体与编码评测上,3.5 Flash-Lite 甚至超过了此前的 Gemini 3 Flash。开发者可在「minimal」「low」等低思考档位间灵活切换以优先追求低延迟,并在多步骤子任务中启用更高思考档位。
Gemini 3.5 Flash Cyber 与 Gemini 4 路线图
针对网络安全应用,DeepMind 发布了专注于该领域的 Gemini 3.5 Flash Cyber,并将其与自家代码安全智能体 CodeMender 组合使用,面向漏洞修复等前沿安全场景。
在路线图层面,DeepMind 表示 Gemini 3.5 Pro 正在与合作伙伴进行测试,将在准备就绪后尽快全面开放;团队已同步启动迄今为止规模最大的预训练任务,目标直指 Gemini 4,相关进展被视为公司下一代旗舰模型的关键信号。
