研究论文
GPT/Claude/Gemini/Kimi 真实任务成本差 10.6 倍,隐性推理 token 是元凶
跨厂商基准测试显示四家主流 API 实际成本差距 10.6 倍而标价仅差 2 倍,根源在于推理 token 按输出价计费…
2026.07.23 · 周四约 2 分钟阅读
一项由独立研究者在 Reddit r/MachineLearning 发布的跨厂商 API 成本基准显示,OpenAI、Anthropic、Google Gemini 与月之暗面 Kimi 在完成同等真实业务任务时,实际花费差距高达 10.6 倍,而各家公布的标价差距仅约 2 倍。报告指出,推理(thinking)过程中产生的隐性 token 是这一巨大差异的主要来源。
核心发现:隐性推理 token 推高账单
测试覆盖分类、检索增强问答、多轮对话以及 agent 规划后执行等 10 类典型产品场景,全部调用各家厂商的「成本优化」档位 API。
- 总成本差距:10.6 倍,对应标价差距仅 2 倍。
- 最典型案例:某模型仅输出一个词的分类结果,却消耗了 197 个不可见的推理 token。
- 计费机制:推理过程产生的 token 按输出价计费,但不会在响应正文中呈现给调用方。
这意味着开发者仅凭响应长度估算成本会严重失真,按「输入+输出 token」做的预算模型也容易出现大幅超支。
与学术研究相互印证
该结果与近期两项工作方向一致:
- CostBench(ACL 2026 接收)发现,主流大模型在选择成本最优执行方案时频繁失误。
- TerminalWorld 报告显示,agent 任务失败时消耗的 token 显著多于成功时,二者相关系数达 -0.62,提示「试错成本」被普遍低估。
两篇工作分别从「模型自身规划不省钱」和「失败路径吞噬 token」两个角度,为本次基准观察提供了学术佐证。
完整方法与原始数据公开
作者已将完整测试方法、原始结果以及全部 10 个任务提示词开源在 GitHub,并在 useweckr.com/benchmark 上线可视化页面,供开发者复现与扩展实验。对于正在按 token 预算选型或搭建 agent 流水线的团队而言,这套基准提供了比厂商报价更具参考价值的成本视角。
