AI 基础设施为何不像传统云计算:四点关键差异
分析认为 AI 基础设施在负载结构、供需集中度、消费模式和客户成熟度上均与传统云计算走向不同轨迹。
尽管每年有大量资金涌入,AI 基础设施(AI infra)仍处于发展早期,但其走向已显现出与经典云计算截然不同的轨迹。文章从四个维度剖析了这种分化:负载结构、供需集中度、企业消费模式以及客户需求成熟度。
负载结构不同:训练才是重头戏
经典云计算为 Web 工作负载而建,开发者构建软件并部署,整个概念里没有「训练」一席之地。AI 基础设施则面向机器学习工作负载,仅在模型部署之前,就需要海量算力用于训练。
若把 ML 类比成 Web,那么「部署一个 Web 应用」最接近的行为是运行推理,但两者存在显著不对称。在经典云时代,Web 是数字体验交付的主要方式,因此绝大多数开发者(即使不负责基础设施运维)也必须熟悉云基础设施。
在 ML 世界,情况并非如此。如今大多数应用构建者(即所谓「智能体构建者」)完全不需要理解 AI infra 或 GPU。除非你在做训练、微调或自托管推理(少数人的专属领域),否则完全可以「通过 API 把 AI 集成进应用」——而这正是绝大多数人在做的事。
供需集中度倒挂:人人想做房东,客户只剩八个
经典云早期即呈现供应端集中:顶级为 AWS、Azure、GCP,中游苦苦挣扎,小型玩家有 DigitalOcean、Linode、Vultr 等。愿意大规模自建并运营数据中心、向他人提供云服务的公司数量始终有限。
消费端则高度分散——基本上每家需要运行应用、网站、数据流水线的公司都是云客户。AI infra 把这个格局翻转了过来:
- 供应端涌现出一批 GPU 专业的新型云厂商,与超大规模云并存。
- 消费端则远为集中。模型训练仅属于少数资本雄厚的实验室;推理的客户稍多一些,但主要消费者仍是模型自研方,以及运行开源权重模型的新一代推理服务商。
经典云时代「人人都是客户,三家公司是房东」;AI infra 则是「人人都想当房东,客户只剩大约八家」。
企业消费模式:这次 PaaS 赢了
经典云以 IaaS 为主导。原因在于大型企业希望(自以为需要)掌控基础设施。尽管 Heroku 等 PaaS 早期颇受欢迎,行业最终仍倒向 IaaS。此外,云计算大量建立在虚拟化等已有成熟认知的基础设施概念之上,许多组织此前就在自有数据中心运维基础设施,能将经验迁移到云上。
AI infra 没有这样的历史包袱。绝大多数企业从未在大规模场景下运营过 GPU。对于推理,PaaS 将成为主流消费模式——无论对企业还是「AI 原生」公司皆是如此。
最流行的闭源模型 GPT、Claude、Gemini 仅通过 API 提供,这使它们在结构上更像 Twilio 或 Stripe,而非 EC2 或 EKS。即便那些通过开源权重模型以 10% 价格获得前沿性能 90% 表现的高阶买家,也绝大多数依赖第三方推理服务商,而非自托管。运行高性能推理所需的硬件与软件栈能力稀缺,企业缺乏自建的动力。
客户需求尚未成熟:「我们手上有 GPU」就是最好的销售话术
随着经典云走向成熟,买家要求不断深化:SLA、合规认证、地理冗余、降低供应商锁定……标准日益精细。
AI infra 尚未走到这一步。GPU 供应紧张如此严峻,以至于最成熟的买家当下首要任务仍是「拿到货」。这也是为何相对年轻的公司能签下财富 500 强客户——CoreWeave 上市时,超过一半收入来自微软。当前 AI infra 最热的销售话术只有一句:「我们手上有 GPU」,仅此而已。
当客户在被配额管控稀缺资源时,他们不会在条款上讨价还价。需求的精细化终将到来,但眼下,可用性本身就是产品。
格局判断
经典云最终演化为商品化、IaaS 主导、消费者广泛而供应商集中的市场。AI infra 正走上不同轨迹:供应商碎片化、消费者集中、PaaS 成为默认消费模式,且买方需求距离云时代的成熟度还有很长的路要走。这套框架对正在评估 AI 基础设施投资方向与企业采购策略的从业者具有参考意义。
