谷歌深夜三连发:三款 Gemini 新模型亮相,Gemini 4 预训练启动
谷歌 DeepMind 一次性推出 Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash…
谷歌 DeepMind 于近日一次性推出三款 Gemini 系列模型——Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber,分别面向通用推理、高频轻量场景与网络安全任务。与此同时,DeepMind 内部已启动「史上最激进的一次预训练」,目标直指下一代模型 Gemini 4。
Gemini 3.6 Flash:Token 节省最高 65%,价格同步下调
Gemini 3.6 Flash 是此次发布的「主力」型号,核心卖点是显著降低 Token 消耗。根据 Artificial Analysis Index 的测算,相比上一代 3.5 Flash,其输出 Token 用量减少 17%,在 DeepSWE 等编码基准上最高可节省 65%。这意味着模型在完成多步任务时所需的推理步骤和工具调用更少,路径更短、效率更高。
在定价方面,3.6 Flash 调整为输入 1.5 美元/百万 Token、输出 7.5 美元/百万 Token,比上一代更具竞争力。性能层面,多项关键基准均较前代有明显提升:
- DeepSWE(编程测试):37% → 49%
- MLE Bench(机器学习研究测试):49.7% → 63.9%
- OSWorld-Verified(电脑操作测试):78.4% → 83%
- GDPval-AA v2(知识型工作任务):得分 1421,比上一代高 70 分以上
此外,借助 Gemini Canvas,3.6 Flash 还展示了 3D 工作流搭建、多智能体编排等能力。
Gemini 3.5 Flash-Lite:系列最快,主打高频走量场景
Gemini 3.5 Flash-Lite 定位为 3.5 系列中速度最快的轻量版本,输出速度可达每秒 350 个 Token,定价低至输入 0.3 美元/百万 Token、输出 2.5 美元/百万 Token,特别适合文档批量处理、Agent 搜索等高频、高并发场景。
值得注意的是,这款轻量模型在多项编程与 Agent 测试中反超了体量更大的 Gemini 3 Flash:
- SWE-Bench Pro:54.2% 对比 49.6%
- OSWorld-Verified:74.0% 对比 65.1%
官方演示展示了「3.6 Flash 拆解任务 + Flash-Lite 批量执行」的协作模式,可一次性输出 25 套网页设计方案。Flash-Lite 目前已在 Gemini App 上线,并将陆续集成至谷歌搜索。
Gemini 3.5 Flash Cyber:专攻漏洞发现与修复
Gemini 3.5 Flash Cyber 是一款面向网络安全任务的专用模型,专注于漏洞发现与修复。DeepMind 将其集成至代码安全智能体 CodeMender 中,通过多个 Cyber 智能体协同,在 CyberGym 安全基准上刷新 SOTA,同时保持低于更大模型的运行成本。不过该模型暂未对普通用户开放。
Gemini 4 已开跑:下一代旗舰进入预训练
在三款新模型发布的同时,DeepMind 确认内部已启动「史上最激进的一次预训练」,目标为下一代模型 Gemini 4。按照谷歌通常约 6 个月的训练节奏,Gemini 4 有望在年底前亮相。对于按 Token 计费、搭建生产级 Agent 的开发者而言,此轮三连发的核心价值指向一个关键词——「降」:价格更低、Token 消耗更少、单次 Agent 执行成本更低。旗舰虽强,终究仍需先落地。
