Google 秘密芯片 Frozen v2:将 Gemini 架构「刻」进硬件
Google 正研发专为 Gemini 优化的服务器芯片 Frozen v2,每瓦 token 数能效可达 TPU 的…
据 The Information 援引知情人士报道,Google 正在秘密研发代号 Frozen v2 的服务器芯片,专门为旗下大模型 Gemini 服务。参与项目的员工称,按每瓦可生成的 token 数计算,该芯片能效可能达到 Google 最新 TPU 的 6—10 倍,预计最早 2028 年才会部署。
为何要把 Gemini「刻」进芯片
理解 Frozen v2,需要先回到传统芯片的工作方式。现代计算机沿用冯·诺依曼架构,处理器与内存彼此分离,软件指令与数据要通过总线反复传输。当运算速度超过数据读写速度时,便撞上「内存墙」。
大模型推理面临的瓶颈正是这道墙。每生成一个 token,模型都要反复读取权重与中间数据,反复执行矩阵乘法与注意力运算。而通用处理器必须保留服务无数程序的控制逻辑,其中大量数据通路在推理时根本用不上。
Frozen v2 的思路更激进:直接围绕 Gemini 的固定结构安排计算单元、存储位置和数据流,让硬件预先知道下一步大概率要做什么,从而极大提升效率。芯片将固化更多架构层信息,但仍保留权重更新能力,避免重蹈初代 Frozen「芯片随模型一起过时」的覆辙。
项目由 Google 首席科学家 Jeff Dean 推动,他是 Google Brain 联合创始人,也是 TensorFlow 的主要设计者之一,长期站在 Google 分布式计算与 AI 基础设施的交界处。
大模型公司集体押注自研芯片
Frozen v2 并非孤例。2026 年 6 月,OpenAI 与 Broadcom 公布自研推理芯片 Jalapeño,团队根据 ChatGPT、Codex 和 API 的真实负载设计芯片,OpenAI 模型也参与了部分设计与优化,从立项到流片仅用九个月。Anthropic、DeepSeek 等公司也均传出自研芯片的消息。
各家专用程度不同,但方向高度一致:掌握模型的公司,正在把每天重复的计算规律交给硬件,进入「模型定义芯片」的时代。
背后的算术并不复杂。以 Google 公开的 Gemini 旗舰模型为例,标准 API 价格约为每百万输入 token 2 美元、每百万输出 token 12 美元。假设一次较重请求消耗 5000 token 输入与 1000 token 输出,单次成本约 2.2 美分;若日均调用 1 亿次,单日支出即达 220 万美元,年化约 8 亿美元。Gemini 应用月活已超过 9 亿,再低的单价乘以这一调用规模,都是天文数字。
Google 的底牌与风险
这一硬件下注,发生在 Google AI 业务剧烈起伏的当口。2022 年 11 月 ChatGPT 发布后,Google 一度拉响「红色警报」;2025 年 Gemini 3 推出、Nano Banana 刷屏,Google 又重回 AGI 竞争第一梯队。然而近期内部再度动荡:Gemini 联合负责人 Noam Shazeer 离职加盟 OpenAI,John Jumper 与多名研究员转投 Anthropic,原定 6 月发布的 Gemini 3.5 Pro 被曝延迟,编码能力未达内部目标,Alphabet 股价接连重挫。据报道,算力短缺甚至曾迫使 Google Cloud 拒绝部分外部客户订单。
但 Google 手中仍有一张对手难以复制的牌:从 Gemini 模型到 TPU 芯片,再到 Google Cloud 数据中心与庞大的产品生态,整条链路都掌握在同一家公司手里,模型与硬件可以围绕同一套需求协同设计。这套积累十年的体系,不会因一次人才跳槽而消失。
风险同样不小。Frozen v2 要到 2028 年才可能部署,届时 Google 仍需决定在芯片上固化多少 Gemini 架构信息。换言之,Google 准备冻结一部分 Gemini 来换取芯片级高效率。这场押注能否兑现,留给 Gemini 追赶的时间已经不多。
