桃子桃子快讯
返回首页
行业动态

闲置 GPU 成新瓶颈:算力时代的「趴窝飞机」

AI 瓶颈从模型能力转向 GPU 利用率,闲置算力如同停场飞机,企业需从采购思维转向运营思维。

2026.07.30 · 周四3 分钟阅读

随着大模型能力趋于成熟,AI 行业的稀缺资源正在悄然位移:不再是参数规模或榜单排名,而是 GPU 实际被利用了多少。Hugging Face 近日发表的评论文章《GPU Management: Why Idle GPUs Are the New Grounded Aircraft》把这一现象比作航空业的「飞机日利用率」——成本按日历小时累积,收入却只按飞行小时计算,闲置本身就是亏损。

瓶颈从模型迁移到算力

文章回顾了企业 AI 的第一波竞争:胜负取决于模型质量——更大的参数、更难的基准、更强的能力。但模型能力再强,也必须跑在专用硬件上,而 GPU 恰恰是当下最稀缺、成本最高、产能最受限的资源。

文章援引公开信息指出,2020 年微软为 OpenAI 搭建的专用超算规模超过 10,000 块 GPU 与 285,000 颗 CPU 核心,在当时已是全球前五的超级系统,用于训练 GPT-3。六年后,这一数字更像起点而非天花板:到 2026 年,即使资本最雄厚的实验室也将算力获取视为现实战略约束,而非已解决的问题。

  • Anthropic 同时在亚马逊、谷歌、微软、AMD 四家硬件平台上达成多吉瓦级承诺,间隔仅数月。
  • Meta 也签署了规模相当的多吉瓦级协议。
  • 跨四家供应商同时下单,反映的是「买家资本几乎无限,单一来源仍不够」的算力稀缺形态。

六年之间,改变的并非 AI 的能力上限,而是能力已不再是约束本身。

API 模式与自建集群的此消彼长

同样的压力也传导到了使用模型的企业端。

  • 通过 API 调用模型的企业,面对的是按 token 线性增长的费用曲线,PoC 阶段看似可控,进入生产后却可能变成长期无法消化的成本项。
  • 越来越多企业选择自购 GPU、本地部署模型,把可变的线性支出换成固定的资本性支出。

跨过盈亏平衡点之后,这一交易的方向会发生逆转:API 成本随用量上升,而自建基础设施的成本基本固定。GPU 也由此从费用项升级为基础设施资产,配置时需为增长、为峰值预留,因此总是大于任一周的实际需求。

采购容易,让 GPU 忙起来才是难题

文章认为,问题在集群上线那天真正开始。采购有截止日期、有责任人、有合同条款;让硬件持续高效运转却没有对应的归属与考核机制。

  • 一笔 GPU 采购合同描述的是「容量承诺」,而非「使用效率」。
  • 容量用得好不好,归不同团队管,度量远未标准化,距离解决也更远。
  • 签下硬件是「有时限」的决策,让它不停闲置才是决定这笔交易是否划算的部分。

文章把 GPU 日利用率类比为航司的飞机日利用率:决定经济学差距的,往往不是机队规模,而是每架飞机每天在天上飞了多少小时。AI 行业正进入同一阶段——智能把行业带到了今天,利用率才是下一个真正成形的约束。

结语

文章在结尾处仍在展开「专业化释放容量、编排消耗容量」的论述(原文于此处截断),但核心结论已经清晰:当模型能力跨过可用门槛,企业的下一道分水岭不在于拥有多少 GPU,而在于这些 GPU 有多少时间真正在跑任务。对正在评估自建算力或扩张集群的团队而言,把「利用率」纳入与「采购价」同等量级的指标,或许比继续追加订单更紧迫。

信源