AI 数据中心的过剩,可能和当年挖矿一样
作者将本轮 AI 数据中心建设类比比特币挖矿周期,指出 NVIDIA 推动的巨额融资与 ASIC 崛起,可能让 GPU…
一篇在 Hacker News 上引起讨论的长文,把当前 AI 数据中心建设与作者十四岁时亲历的比特币挖矿周期并置:芯片换代、需求见顶、机器仍能运转却成为糟糕资产——这条路径是否会重演。作者认为,关键变量不是「人们是否继续使用 AI」,而是「稳定的推理负载是否会在债务到期前迁移到专用芯片」。
一笔半万亿美元的「销售话术」
文章首先把目光投向 NVIDIA。2026 年 8 月 10 日,NVIDIA 宣布与六家大型资管机构(Apollo、BlackRock、Blackstone 等)合作,计划调动超过 5000 亿美元外部资本为 GPU 交易提供融资;黄仁勋随后表示,NVIDIA 可能在单个项目中为机器残值提供最高 25% 的支持。作者认为,比金额更重要的是交易结构:卖芯片的公司正在协助组织买方资金,「残值」在当前这一轮建设尚未结束时,已经被写进销售材料。
与之并行的是 ASIC 阵营的估值跃升:Etched 凭一款专攻「GPU 最稳定负载」的 ASIC 拿到约 100 亿美元估值;OLIX 在十一天前以 33 亿美元估值融资 3.12 亿美元。
推理是内存问题,不是算力问题
文章的核心论点落在推理(inference)的物理特性上:每生成一个 token,机器都要把模型权重和对话上下文从内存中读出,其余加速器多数时间在等待。一旦芯片针对一个固定模型设计,就可以把权重直接铺在晶圆上,省掉这趟往返——这是 ASIC 在重复负载上击败通用 GPU 的来源,也是「必须把芯片焊死在单一模型上」的代价。
由此,问题被改写为「哪类工作会长时间保持稳定」。已经被迁移的工作是「无聊」的:Meta 表示 MTIA 芯片已用于推荐模型,未支持模型仍跑在 GPU 上;亚马逊在 4 月披露过去十二个月部署超过 210 万颗 AI 芯片,其中过半为自研 Trainium,同时仍在采购逾百万颗 NVIDIA GPU。作者的判断是,巨头会把稳定、高频、可重复的推理搬到自研芯片,GPU 保留模型变更快、软件栈不兼容、需求尖峰、要求广兼容性的部分。
反对意见里最有分量的是 Google
作者主动承认,Google 是这一框架下最难绕过的反例:Google 已用自研芯片跑自身稳定推理约十年,期间 NVIDIA 数据中心业务持续增长、Google 全程仍在采购 GPU。如果「迁移本身」就足以终结 GPU 故事,所谓「过剩」早该发生。
作者把赌注收得更窄:不是预测「稳定工作开始迁移」——这件事已经发生十年——而是预测「如今这批用借款买入、对应六年期账期的 GPU 机队,会先于债务失去这些工作」。
模型在变,「焊死」的代价在涨
文章最后给出三种会让自己判断落空的情形:自定义芯片编程体验长期糟糕、模型更迭吃掉节省的成本、老旧 GPU 在硬件换代中保留住带名字的工作负载并持续产生现金流。任何一条成立都足以推翻预测,而「AI 需求继续增长」并不能消解它们。
其中最让作者担忧的是模型本身的演进:Transformer 并不固定,MoE、更长上下文、让模型「思考更久再回答」的范式都在让推理负载变得不那么规律。过早焊死一颗芯片,等于把赌注押在去年的假设上。这与 AGI 是否来临无关:模型继续进步,稳定工作会更早迁移;模型停滞,债务依然比机队活得更久。
作者在文末留了一份带打分条件的预测清单,并承诺以公开账本记录对自己不利的判断,把「观点」与「自我修正」摆在一起。
