基于黄仁勋提出的 AI 基础设施五层框架,逐层拆解能源、芯片、基础设施、模型与应用在 Token 生产中的成本占比,解释…
在聊天框里敲下一句话,等待几十毫秒,屏幕便出现一段看似流畅的回答。对大多数用户而言这是一个十分轻量化的过程,但到了付款页面,输入多少百万 Token、输出多少百万 Token、上下文多长、缓存是否命中——这些名词会突然变得刺眼。一个看不见、摸不着的回答,为何要按量收费?要回答这个问题,需要把生产成本、市场价格和任务成本三张账单分开看。AI 既有软件的一面(算法可迭代、模型可压缩、服务可通过接口分发),也有越来越显著的另一面:每一次生成都要消耗真实的电力、显存、网络与机房资源,边际成本并不会随着复制而趋近于零。换言之,Token 看似软件,骨子里却越来越像重工业。
2026 年 1 月,英伟达 CEO 黄仁勋在达沃斯世界经济论坛上首次将 AI 基础设施描述为一块「五层蛋糕」,自下而上分别是能源、芯片、基础设施、模型和应用。此后他在 CES 2026 和 GTC 2026 大会上反复使用这一框架。《Token 经济》一书把整个系统形容为「一条实时运行的认知生产线」:用户输入、上下文、工具说明和企业知识库像原材料,电力、芯片和推理时间像能源,模型架构、缓存机制、路由策略和工作流编排则像工艺。理解 Token 的成本,需要先理解这块从底向上的蛋糕。
GPU 运算、冷却系统和网络传输都依赖电力。按美国工业电价每千瓦时 0.06–0.08 美元计算,一座 500 兆瓦的数据中心年电费超过 3 亿美元。但电力在「运营成本」中显眼,一旦把 GPU、HBM、网络和机房资本折旧都计入,能源层并非最大项。SemiAnalysis 的推理 TCO 模型显示,机房租赁与电力合计通常不到总拥有成本的 20%。
GPU/AI 加速器、HBM、芯片间互联和 CPU 构成 Token 成本的主体。一块英伟达 B200 价格约 3 万–4 万美元;从 BOM 口径看,HBM 与先进封装合计约占高端芯片制造成本的三分之二。模型参数必须驻留在 HBM 中才能高效推理,HBM 容量与带宽直接决定推理速度与并发上限。全球 HBM 产能由 SK 海力士、三星、美光三家寡头垄断,合计占比超过 99%;AI 需求叠加寡头格局,使超大规模云厂商资本开支中内存的占比从 2023–2024 年的约 8% 飙升至 2026 年的约 30%。
这一层包括机房建设、供配电、液冷散热、机柜、光模块、线缆与 InfiniBand 网络,以及大规模集群调度和运维系统,任务是把成千上万张芯片组织成一座协同运转的 AI 工厂。该层占比弹性很大:GPU 利用率从 60% 提升到 80%,摊到每个 Token 上的成本就会显著下降。
包括训练成本摊销、推理框架优化、模型服务编排和监控。GPT-4 纯计算口径训练成本约 4000 万美元,奥尔特曼公开口径「超过 1 亿美元」,GPT-5 级别已进入数亿到十亿美元级,且实际投入需考虑试错系数。这一层也是工程优化最密集的领域:以 DeepSeek V4 为例,其总参数量达 1.6 万亿,每次推理只激活约 490 亿参数(约 3%);蒸馏技术则可让小模型以约 1% 的推理成本复现大模型能力。
最上层是界面、集成、合规与内容安全,把模型能力转化为用户可购买、企业敢采购的服务。
需要说明的是,上述比例并非企业财务报表标准,而是对大规模商用推理场景的拆解视角。自建还是租用、前沿模型还是经济模型、任务长短,都会改变各层权重。但硬件相关的三层通常构成成本主体,合计占七成上下甚至更高。
两个常见误会需要澄清。第一,把 Token 看成「电力的转售」:一次对话的电费可能只有几厘钱,但单 Token 边际电耗只是完全成本的一小部分,还要摊入芯片折旧、显存带宽机会成本、机房利用率和服务质量溢价。第二,只看单 Token 成本而忽略同等 Token 背后的成本差异:前沿旗舰模型与经济档模型推理成本可相差数十倍;长上下文任务比短问答更吃显存;批处理任务能把集群利用率从 60% 提升到 70%–80%。2026 年谷歌推出分层推理定价,按等待意愿把同一模型分成优先、标准、灵活、批处理四档,批处理档直接半价。
此外还有一个时间差:英伟达推理硬件每代性能提升 2–3 倍、功耗增加不到 50%,折合每 Token 硬件成本每代下降 40%–60%;但从架构发布到大规模交付通常需要 12–18 个月,B200 于 2024 年 3 月发布,2025 年底才大规模交付。便宜算力在特定时间、特定地点仍是稀缺品。
理解五层成本后,就能看清 Token 经济最矛盾的一面:算法侧价格在快速下降,物理侧供给却依然紧张。书中把这概括为「双时钟」——「算法、软件是快时钟;芯片、数据中心、电力是慢时钟」。
快时钟有多快?斯坦福《2026 年 AI Index 报告》估算,过去 3 年同等能力水平的推理成本下降了 99.5%,降至原来的 1/250。MoE、注意力优化、蒸馏、推测性解码等技术以天和周为单位迭代。
慢时钟有多慢?书中列出四重物理约束:
两套时钟同场运转,便形成 Token 市场的独特景观:算法突破可以快速压低价格,物理供给却依然紧张;利用率提升能摊薄成本,可一旦容量到顶,新增 GPU、机房和电力合同又会让成本阶梯式跳升。
Token 没有「死价格」:市场价格会变,模型会换代,成本结构也因任务和部署形态而异。但确定的是,每一枚 Token 都需要真实的能源、芯片和基础设施去生产。这正是认识 AI 经济的起点。
过去互联网的叙事是「代码写一次,服务无限人,边际成本趋近于零」;而 Token 经济把物理世界重新拽回故事的中心。当智力服务成为可计量、可调用的商品,未来竞争的就不再只是更会写代码的公司,而是谁能更高效、更可持续地把能源、芯片、模型和人类需求组织起来的公司——模型公司竞争的是把每一度电、每一张卡转化为更多高价值 Token,云厂商竞争的是把芯片、网络和机房跑得更满,应用公司竞争的是证明这些 Token 确实换来了用户愿意付费的结果。当智力服务开始被计量、被调用、被定价,AI 真正进入的就不只是聊天框,而是一套新的工业秩序。