LLM 推理有多赚钱:以 Kimi K3 为例拆解成本结构
以 Kimi K3 为样本测算 LLM 推理边际成本,并与市场售价对比,揭示推理服务的盈利空间。
LLM 推理到底有多赚钱?一篇在 Hacker News 上引发讨论的技术分析文章以月之暗面(Moonshot AI)最新开源的 Kimi K3 为样本,从 GPU 租用成本、批处理规模、KV 缓存复用等维度,搭建了一套「每百万 token 成本」的测算模型,并得出一个让从业者略感意外的数字:在帕累托最优配置下,单卡边际成本仅约 1.37 美元,而 OpenRouter 上 Kimi K3 的 output 报价约为 15 美元每百万 token。
推理定价的基本框架
作者把 LLM 推理的商业模式抽象为两件事:租 GPU 跑权重,按 token 收费。模型权重必须加载到至少一张 GPU 上才能工作,Kimi K3 这种万亿参数级别的前沿模型仅靠单卡装不下——量化到 MXFP4 后权重仍约 1.4 TB,至少需要 8 张显存 288 GB 的 B300(约 2.3 TB 显存总量,留出 KV 缓存余量)。
GPU 按小时计费,目前 Lambda、Runpod 等平台上 B300 的时租价格约 7 美元。Token 则按百万为单位计费,且 input、output、cached 三种价格差异显著:作者给出的 Kimi K3 在 OpenRouter 上的报价是 input 3 美元、output 15 美元、cached input 0.30 美元每百万 token。
批大小与并行度的「Pareto 前沿」
推理经济学里有两个关键旋钮:批大小(b)与并行 GPU 数(N_GPU)。前者指一次前向传播同时处理多少请求,后者指把单个模型拆分到几张卡上运行。两者共同决定 token_latency——每生成一个新 token 所需的秒数——进而决定每个用户感知到的「每秒多少 token」。
- N_GPU 越大:总算力与显存带宽越高,能容纳更大的批;
- N_GPU 越大:跨卡通信开销也越大,延迟上升;
- b 越大:每张卡分摊的固定成本越低,单价越便宜;
- b 越大:每次前向的数据量增加,延迟也会变大。
把不同 (b, N_GPU) 组合对应的(速度、价格)画在图上,就得到一条「无法只优化一个而不牺牲另一个」的 Pareto 前沿。前沿上的每一个点,就是该速度下的最优价格。Fireworks 同时提供 15 美元与 22 美元两档 Kimi 推理服务,对应不同 (b, N_GPU) 取舍,正是这条前沿的现实体现。
Kimi K3 的边际成本测算
作者以 vLLM 团队公布的前沿数据为基础,选取 8 张 B300 这一 Pareto 最优点:单用户约 30 tok/s,单卡聚合吞吐约 1,500 tok/s。换算如下:
- 单卡每小时产出 ≈ 1,500 × 3,600 = 5,400,000 token;
- 时租成本 7.39 美元;
- 每百万 token 边际成本 ≈ 7.39 ÷ 5,400,000 × 1,000,000 ≈ 1.37 美元。
这与 OpenRouter 上 15 美元的 output 报价相差超过 10 倍。是不是推理服务商在躺着赚钱?作者给出的判断相对克制:「也许是一声轻笑,还不到大笑」。
利润空间的两大折扣
第一个折扣是利用率不到 100%。推理资源要按峰值而非平均需求来准备,编码类模型在夜间、周末、节假日活跃度天然下降;规模越大的服务商,跨地域、跨客户的平滑效应越强,但 50% 的平均利用率是合理假设,这意味着边际成本立刻翻倍到约 2.7 美元。
第二个折扣是这只是边际成本。工资、其他 IT 支出,以及最关键的——训练与微调成本——都还没算进去。模型是折旧资产,开源权重满天飞的今天,有人必须为训练买单,这笔账最终会以某种形式分摊到推理价格上。
作者在文末提到,vLLM 公布的 DSpark 投机解码方案可带来约 3 倍加速,KV cache offloading、prefill/decode 解耦等优化仍在演进。任何推理服务商手里都可能握着一张「让经济模型比这次粗算更有利可图」的暗牌,但同样也可能存在被普遍忽略的固定成本黑洞——盈利与否,最终仍要看具体运营效率与定价策略。
