WAIC 算力展商扎堆,真正能做算力服务的只是少数
WAIC 上 AI Infra 公司扎堆,但卖铲人与做算力服务是两件事;文章以三本账框架解释为何算力服务终将向少数主体集…
2026 年的 WAIC 上,机器人仍占据最多镜头,但展馆里数量增长最快的是自称「AI Infra」的公司:做液冷、交换机、存储、集群软件的厂商,名片上都多了「AI 基础设施」一行。然而走出展馆就会发现,产业链热闹与算力服务的真实格局并不对得上——过去三年建成的大批智算中心,一部分满负荷排队,另一部分正以接近成本的价格公开招商;模型企业和科研机构却仍在抱怨算力紧张。卖铲子的公司越来越多,市场上「能用的算力」却没有同步变多。
部件的进步,不会自动变成可用的算力
算力看似可以像水电一样按卡、按小时标准化计费,实则不然。同样数量的计算卡,置于不同的网络、存储与软件环境,最终交付的有效算力差异巨大:一套集群擅长大模型推理,未必扛得住高通信负载的训练;能跑主流开源模型,也不意味着能直接承接科学计算或工业仿真。
产业链各环节交付的是部件性能,用户需要的却是系统层面的结果——任务按时跑完、稳定运行。中间的工程整合工作——驱动适配、存储瓶颈排查、集群通信效率调优——恰是大多数参与者并不涉足的环节。于是出现了算力短缺与资源闲置同时存在的悖论:撮合平台能告诉你哪里还有空闲卡,却解决不了调度层面的不兼容;资源方能出租设备,却帮不了客户迁移应用;集成商能建起系统,却不一定能持续导入任务。用户缺的从来不是一张卡,而是一套「开箱即用、运行稳定、故障兜底」的计算环境。
一张计算卡背后,要算清三本账
头部云厂商在标准化场景里已经足够成熟,但云的商业模式天然优先服务需求量大、负载可预测的客户,对科学计算与工业仿真(高定制、低规模)、政企与科研客户(数据主权、本地化、信创要求)、跨芯片跨中心的异构资源整合三类需求覆盖有限。
算力服务这门生意能否成立,关键在三本账能否同时算清:
- 建设账:机房、服务器、网络、液冷、电力全部要前期投入,主要设备按 4–5 年折旧,而客户可能只租几周甚至几天;AI 芯片与系统架构更新周期已压缩到一年左右,技术迭代跑赢折旧是首要风险。轻资产平台看似避开了这一风险,实际只是把风险转移给了设备所有者。
- 运营账:Meta 训练 Llama 3 时披露,1.6 万卡集群在 54 天训练周期内发生 400 余次意外中断,平均每 3 小时一次,主要源自 GPU 与内存硬件故障。放到十万卡量级、异构芯片、训练推理科研混跑场景,风险变量只会更多。运营不再是简单分配算力,而是持续处理资源编排、任务优先级、故障隔离、动态迁移与系统恢复。
- 客户账:大模型训练消耗迅猛、项目结束需求断崖;推理对响应与成本锱铢必较;科研任务周期长且精度要求高;工业客户则看重数据安全与本地部署。算力平台必须把这些参差需求拼成一张完整排期表,靠负载互补削峰填谷。
能把三本账纳入同一个体系的,才是算力服务
以三本账为标尺重新审视 AI Infra 市场,分界线相当清晰:大多数参与者只算其中一本,极少数主体能在同一体系内通盘统筹。三本账同时算清的主体有三个难模仿的特征:
- 拥有规模化的驻场工程团队,长期驻扎在客户与系统一线;
- 敢于承受长周期基础设施投入,穿越建设期、爬坡期与技术切换期;
- 掌握决定服务质量的关键环节——网络、存储、调度、软件适配——或确保其处于自己可高效协调的范围内。
国内符合条件的主体屈指可数:少数具备系统工程能力的算力企业,以及手握网络、数据中心与政企服务体系的运营商。两类能力并不相同,实际业务中往往互为补充。它们真正稀缺的不是买设备的钱,而是「没有退路」:利用率不足自己扛、系统出问题自己上、客户任务跑不起来无法推诿。
分工仍在,责任不能分散
算力服务向少数主体集中,并不意味着其他玩家出局。集群规模越大,调度、监控、计量计费、自动化运维与性能优化越值钱;异构资源越多,越需要专业平台帮用户屏蔽底层差异;行业客户涌入后,还需要更懂业务的服务商完成模型部署与应用迁移。这些环节做深了,都是难以替代的位置。
可预见的格局是:由承担最终责任的系统级主体担任「链主」,统揽系统稳定、任务交付与客户服务;软件平台、数据中心、集成商及行业服务商在各自环节做到不可替代,通过标准化接口与责任约定接入整体交付体系。全国一体化算力网相关文件也已明确提出发展「专业化算网运营主体」——关键词是专业化运营,而非更多资源入口。建设阶段比的是设备数量、峰值性能与集群规模;进入运营阶段后,利用率、任务完成率、故障恢复时间、应用覆盖率与单位计算成本,将成为新的记分牌。
