谷歌被曝设计 Gemini 专用芯片 Frozen v2,目标每瓦 Token 提升 10 倍
据报道谷歌正在研发内部代号 Frozen v2 的服务器芯片,将 Gemini 模型结构嵌入硬件,最早 2028 年部署…
据《The Information》援引知情人士报道,谷歌正在设计一款内部代号为「Frozen v2」的服务器芯片,计划把 Gemini 模型的部分信息直接固化进硬件,以提升模型推理效率。该项目最早可能在 2028 年部署,按照内部预期,以单位能耗产出的 Token 数衡量,其效率有望达到谷歌最新自研 AI 芯片的 6 至 10 倍。不过谷歌并未正式确认 Frozen v2 会量产,仅向 TechCrunch 表示公司一直在研究和试验新技术,并强调「并非每个项目最终都会投入生产」。该芯片消息公布后,Alphabet 股价在 7 月 20 日早盘上涨约 3.3%。
Frozen v2 不是下一代 TPU
理解 Frozen v2 的关键,在于它并非谷歌下一代 TPU 的代号,而是与 TPU 并行、独立的新芯片体系。路透社援引《The Information》报道称,谷歌仍在同时推进 TPU 路线,其中一款代号为「Icefish」的下一代处理器也计划在 2028 年量产,主要计算部分拟由台积电制造,连接内存的组件则讨论由三星以 2 纳米工艺生产,并与联发科共同设计。
这意味着谷歌可能同时拥有两类定位不同的 AI 芯片:
- TPU:仍是面向矩阵计算、训练和推理的通用 AI 加速器,可承载不同规模、不同架构的模型,并通过 Google Cloud 提供给外部客户。
- Frozen v2:可能把部分 Gemini 模型结构、参数或特定计算模式更深入地映射到硬件,以牺牲一定通用性换取更高推理效率。
从产业角度看,这相当于把 AI 芯片的专用化程度又向前推了一层:GPU 依赖通用并行计算,TPU 针对张量计算做了优化,Frozen v2 则进一步针对某一模型家族定制,硬件面对的不再只是「什么样的 AI 计算」,而是「Gemini 具体怎样计算」。
TPU 走向更开放,Frozen v2 走向更封闭
两条路线在产品策略上恰好相反。2026 年 4 月,谷歌发布第八代 TPU,并首次将同一代产品分成 TPU 8t 与 TPU 8i 两种架构:TPU 8t 用于大规模预训练,TPU 8i 面向低延迟推理与 MoE 模型服务。官方披露,TPU 8t 大规模训练中每美元性能最高可达上一代 Ironwood 的 2.7 倍,TPU 8i 在低延迟 MoE 推理中每美元性能最高提升 80%,两款芯片的每瓦性能最高均可达到 Ironwood 的两倍;TPU 8i 还配置了 288GB 高带宽内存和 384MB 片上 SRAM。
与此同时,Alphabet 在 2026 年第一季度财报会上宣布,将开始向部分客户直接交付 TPU 硬件,允许其部署在自有数据中心内,相关收入将在 2026 年下半年起确认、大部分在 2027 年体现。这意味着 TPU 正逐渐变成对外输出的计算平台,需要支持 JAX、PyTorch、vLLM、XLA 等软件栈,谷歌也在第八代中强调原生 PyTorch 体验与跨代代码兼容。
Frozen v2 则可能走向相反方向:它不需要服务大量外部模型,也不必建立类似 CUDA 的生态,只要能稳定运行 Gemini 并被搜索、Gemini App、Workspace、广告和云服务大规模调用,谷歌就有机会摊薄芯片研发成本。因此谷歌的芯片战略正形成一种「双轨制」:TPU 扩大基础设施的通用性与商业半径,Frozen v2 则把核心模型的单位运行成本压到更低。
1800 亿美元资本开支背后
Frozen v2 真正值得关注的,并非「6 至 10 倍」这个尚未验证的数字,而是谷歌选定的衡量指标:单位能耗产出的 Token 数量。随着大模型进入大规模推理阶段,单芯片峰值算力已无法直接决定商业效率,更现实的问题是:在相同电力与服务器预算下,能处理多少请求、生成多少有效 Token、维持怎样的响应速度。尤其在 Agent 场景中,一次用户请求可能触发规划、搜索、工具调用、代码执行、结果验证与多轮反思,背后的 Token 消耗远高于聊天场景,芯片在数据搬运、内存访问与低批量推理中的效率直接影响产品毛利率。
这一选择与 Alphabet 快速膨胀的资本开支密切相关。2025 年 Alphabet 资本开支为 914 亿美元,其中约 60% 投向服务器、40% 投向数据中心和网络设备;2026 年第一季度,公司又将全年资本开支指引上调至 1800 亿至 1900 亿美元,接近 2025 年的两倍,且 2027 年还将显著高于 2026 年。Alphabet 管理层表示,内外对 AI 算力的需求均达到前所未有的水平,Google Cloud 仍处于算力供应紧张状态。
Gemini 的特殊价值在于,它不仅是一款独立应用,还深度嵌入搜索、广告、Workspace 与 Google Cloud。只要模型被部署到足够多的产品中,即便每次调用只节省少量能耗与时间,累积到数十亿次请求后,就可能转化为显著的基础设施成本差异。这正是市场关注的焦点:谷歌是否找到了降低 AI 基础设施资本强度与运行成本的方法。
专用芯片的最大风险
不过,芯片效率提升并不自动转化为资本回报改善。一款芯片能否真正降低成本,取决于制造良率、先进封装、内存供应、服务器部署速度、软件适配、实际利用率与芯片生命周期。更关键的风险在于模型迭代周期:Gemini 类模型的架构变化通常以月计,而先进芯片从设计到量产往往需要数年。Frozen v2 计划 2028 年发布,谷歌必须判断哪些 Gemini 能力在未来两年内仍保持稳定,而不是把快速变化的特征过早固化在硅片中。
谷歌自身也为项目的不确定性留出了余地,明确表示「并非所有研究项目都会进入生产阶段」。这意味着 6 至 10 倍的效率数字目前更接近内部设计目标,而非经过公开验证的产品指标。
