Google 连发三款 Gemini Flash 新模型,主打更省更便宜
Google 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,…
Google 近日一口气更新了 Gemini Flash 产品线,发布三款新模型:定位主力干活的 Gemini 3.6 Flash、走极致性价比路线的 3.5 Flash-Lite,以及专注代码安全的 3.5 Flash Cyber。官方博客用「更高效」「更聪明」「为大规模 AI agent 而生」形容这批更新,重点强调 token 效率与单位任务成本的下行。然而第三方测评与社区实测反馈与官方话术形成明显温差,也让缺席的 3.5 Pro 成为讨论焦点。
Gemini 3.6 Flash:省 token、降价格,定位 workhorse
3.6 Flash 被官方称为「主力模型」,是今年 5 月 3.5 Flash 的小版本迭代。核心卖点是更高的 token 利用率:根据 Artificial Analysis Index 的数据,3.6 Flash 比 3.5 Flash 输出 token 减少 17%,在 DeepSWE 等场景上最高可省 65%;官方同时表示,多步推理与工具调用次数也明显下降。
价格同步下调:输入 1.5 美元 / 百万 token,输出 7.5 美元 / 百万 token,相比上代 3.5 Flash 输出价 9 美元 / 百万 token 直接砍掉 1.5 美元。
能力侧,官方给出的一组关键 benchmark 数据如下:
- 代码能力 DeepSWE 从 37% 提升到 49%;
- 机器学习研究方向 MLE Bench 从 49.7% 提升到 63.9%;
- 计算机操作 OSWorld-Verified 从 78.4% 提升到 83%;
- 知识工作 GDPval-AA v2 从 1349 提升到 1421。
此外,「computer use」正式成为 Gemini API 和企业版的内置工具;知识截止日期从 2025 年 1 月推进到 2026 年 3 月。安全方面,3.6 Flash 引入升级版 Frontier Safety 防护,重点针对 CBRN 与网络攻击相关的滥用与越狱行为。Hebbia、Harvey、Figma、JetBrains 等客户对文档解析、图表分析和报告起草等场景给出正面反馈。
3.5 Flash-Lite:以小博大,可调推理档位
3.5 Flash-Lite 定位更低,主打高吞吐、低延迟任务,例如 agent 搜索与文档批处理。按官方数据,其出 token 速度可达每秒 350 个,价格低至输入 0.3 美元、输出 2.5 美元 / 百万 token。设计上的亮点是支持调节「推理档位」,轻量任务用低档省钱,复杂子任务再拨高档。
相比 3.1 Flash-Lite,其主要提升包括:
- 代码与 agent 任务 Terminal-Bench 2.1 从 31% 提升到 54%;
- 长上下文 GDM-MRCR v2 从 60.1% 提升到 72.2%;
- 真实任务执行 GDPval-AA v2 从 642 提升到 1140。
值得注意的是,3.5 Flash-Lite 在 SWE-Bench Pro(54.2% vs 49.6%)、OSWorld-Verified(74.0% vs 65.1%)等任务上反超了规格更高的 3 Flash,被官方视为以小博大的代表场景。
3.5 Flash Cyber:闭门内测的安全专用模型
3.5 Flash Cyber 基于 3.5 Flash 微调,目标是批量查找与修复代码中的安全漏洞,搭配 Google 自家的 CodeMender 工具使用——后者由多个 Flash Cyber agent 协同工作、汇总报告。在业内常用的 CyberGym 基准上,官方称其达到第一梯队水平,同时比更大模型更省 token。
考虑到攻防两面性,该模型只对「可信合作伙伴」限量开放内测,策略与 Anthropic 类似的安全叙事一致:优先服务防守方,争取在漏洞被利用前完成修复。
缺席的 3.5 Pro 与社区反弹
在三款 Flash 发布的同时,真正受关注的旗舰 3.5 Pro 并未亮相。官方口径为「正与合作伙伴测试、准备好就上」,但据彭博社等媒体报道,3.5 Pro 的代码生成能力未达内部预期,Google 在 6 月下旬专项更新训练数据后仍未达标,有传闻称其训练方案被推翻重训。与此同时,Google AI 方面的 Logan Kilpatrick 把宣传重心提前转到了已启动预训练的 Gemini 4,舆论上几乎「跳过」3.5 Pro。
社区和第三方机构则给出了与官方不同的判断。Artificial Analysis 表示,3.6 Flash 的智能水平相比 3.5 Flash 几乎原地踏步,Flash-Lite 智能指数提升约 11 分,但 3.6 Flash 单任务的成本节省不足以覆盖能力上的平淡。X 平台上多位网友将 3.6 Flash 与 GPT-5.6 Sol medium、Meta Spark 1.1、GLM-5.2、Sonnet 5、Grok 4.5 等对手对比,认为其「又贵又笨」,直接冲击了 Flash 系列「性价比」的立身之本。
此外还有网友贴出实测,称 3.6 Flash 在基础解码、中文选词、图片视频生成、工具调用等方面均出现退步,并将其归因于 Google 将算力倾斜给 Anthropic 等外部客户以推进「Cloud First」策略。
一边是官方账本上更省、更快、更便宜的数据,一边是 3.5 Pro 跳票、社区口碑走低的现实。三款 Flash 能否为 Google 稳住 Gemini 的基本盘,最终仍要看年底前 3.5 Pro 与 Gemini 4 预训练的兑现情况。
