电力取代 GPU,成为 AI 数据中心新瓶颈
AI 算力建设的核心约束正从 GPU 供应转向电网接入与电力容量,Gartner 预计 2027 年四成 AI 数据中心…
AI 基础设施建设的核心瓶颈正在悄然切换:2024 年业界苦于 H100 一卡难求,进入 2026 年,限制新算力落地的关键已变成「把 GPU 插到哪里才能拿到稳定的电力」。Gartner 预计到 2027 年将有 40% 的 AI 数据中心受电力约束,美国与欧洲主要市场的电网扩容审批周期已普遍拉长至 24–36 个月。硬件供给侧的紧张逐步缓解,但电力侧的瓶颈并未随之打开。
从 GPU 短缺到电力短缺
2023 至 2024 年的主线矛盾是 TSMC 的 CoWoS 封装产能和 SK 海力士的 HBM 供给,采购排长队、芯片供不应求,团队卡在「拿不到卡」,而不是「没地方插电」。过去 18 个月里,H100、H200 以及 Blackwell 系列的供应明显改善,新型云服务商和转售商已经能够提供两年前完全无法获得的算力,电网扩容却没有跟上节奏。
IEA 在 2025 年发布的《Energy and AI》报告预测,全球数据中心用电量到 2030 年可能翻番,其中 AI 工作负载贡献了绝大多数增量需求。北弗吉尼亚、硅谷、北欧等核心市场的电力扩容审批已经普遍需要 24–36 个月,与硬件是否就绪无关。这是一类截然不同的问题:电网审批排队无法通过同址追加资本开支来加速——「排队就是排队」。
电力需求的数字量级
理解这一约束为何如此尖锐,关键在于 AI 基础设施的电力规模本身。单台 8 卡 H100 SXM5 节点在推理负载下约消耗 10.1 kW,其中 GPU 本身约占整机功耗的 56%,其余来自双路 CPU、NVLink 交换机、512 GB 内存和电源满载开销。把它乘到集群规模,电力需求呈现非线性扩张:
- 100 张 GPU:约 176 kW,普通商业供电即可满足
- 500 张 GPU:约 880 kW,需专用变压器并协调电力公司
- 1,000 张 GPU:约 1.76 MW,需要专用变电站容量
- 5,000 张 GPU:约 8.8 MW,相当于中型电力变电站规模
- 10,000 张 GPU:约 17.6 MW,专用电力互联,审批周期 2 年以上
- 50,000 张 GPU:约 88 MW,需大规模电力规划,审批周期 36 个月以上
上述估算基于 700W H100 TDP × 1.8 服务器开销系数 × 约 1.4 的 PUE,实际值会随工作负载波动。新一代超大规模园区设计容量已经达到 100 MW 至 750 MW+ 量级,单个园区开始与市政电力基础设施直接竞争资源,审批流程也更接近工业设施而非办公楼宇。Gartner 的 40% 比例其实是一个滞后指标:当下正在规划新数据中心容量的团队,已经撞上这道墙,而不是在预测它。
推理而非训练,是电力曲线的真正推手
训练是一次性、有明确终点的计算任务:跑完设定的步数、集群即可关机,电力成本是可核算的项目支出。推理则完全不同——每一个部署的模型、每一次 API 调用、每一个用户请求都在 7×24 小时地持续消耗电力,没有天然的停止点。一款日活 1 万的应用每天会产生数百万次推理调用,永不结束。
容量规划上的含义是直接的:电力合同不能只按训练峰值来签。一旦有产品上线,推理的稳态负载会迅速成为主导。行业分析预计,到 2030 年推理将占 AI 能耗的约 75%。在这一语境下,tokens per watt(每瓦产出的 token 数)正在取代 FLOPS per dollar 和 GPU 利用率,成为衡量效率的核心指标。一条简化公式是:营收 = 每瓦 token 数 × 可用吉瓦数。当吉瓦数被电网锁死,提升每瓦 token 数就成了唯一可控的效率杠杆。
在等不到电力的前提下做容量规划
面对 24–36 个月的排队周期,工程团队有三类现实策略可以立刻执行,而不必等待新变电站落成。
效率优先:把每瓦 token 数拉满
- FP8 量化:降低激活显存压力与 KV cache 体积,让同等电力下承载更大的有效 batch。在 H100 + vLLM 上,相比同 batch 的 BF16,FP8 通常能提升 30–40% 的 tokens/sec,对应每 token 电费下降约 23–29%。
- 持续批处理(Continuous Batching):对多数推理部署来说,这是单点收益最高的改动。GPU 在 20% 利用率下逐条服务请求时,功耗与 80% 利用率搭配持续批处理几乎相同,而后者每瓦产出的 token 数大约高出 5–10 倍——并非简单的 4 倍关系,因为 TDP 本身更接近固定开销。
- KV cache 管理:降低活跃显存压力,让单卡服务更多并发用户,从而在不扩容集群的前提下提高吞吐。
可追踪的核心指标:tokens/sec ÷ GPU TDP(W)。任何提升该比值的改动,都等于在不增加基础设施的前提下提高了电力效率。
时序调度:把负载搬到谷电时段
批量推理任务、embedding 生成、非交互式工作负载可以安排在电网谷段执行。许多市场夜间电价较白天下降 30–50%,把训练任务和异步作业迁过去,配合分时电价合同,能在不增加总用电量的前提下显著降低电费支出。
