桃子桃子快讯
返回首页
研究论文

GPT/Claude/Gemini/Kimi 真实任务成本差 10.6 倍,隐性推理 token 是元凶

跨厂商基准测试显示四家主流 API 实际成本差距 10.6 倍而标价仅差 2 倍,根源在于推理 token 按输出价计费…

2026.07.23 · 周四2 分钟阅读

一项由独立研究者在 Reddit r/MachineLearning 发布的跨厂商 API 成本基准显示,OpenAI、Anthropic、Google Gemini 与月之暗面 Kimi 在完成同等真实业务任务时,实际花费差距高达 10.6 倍,而各家公布的标价差距仅约 2 倍。报告指出,推理(thinking)过程中产生的隐性 token 是这一巨大差异的主要来源。

核心发现:隐性推理 token 推高账单

测试覆盖分类、检索增强问答、多轮对话以及 agent 规划后执行等 10 类典型产品场景,全部调用各家厂商的「成本优化」档位 API。

  • 总成本差距:10.6 倍,对应标价差距仅 2 倍。
  • 最典型案例:某模型仅输出一个词的分类结果,却消耗了 197 个不可见的推理 token。
  • 计费机制:推理过程产生的 token 按输出价计费,但不会在响应正文中呈现给调用方。

这意味着开发者仅凭响应长度估算成本会严重失真,按「输入+输出 token」做的预算模型也容易出现大幅超支。

与学术研究相互印证

该结果与近期两项工作方向一致:

  • CostBench(ACL 2026 接收)发现,主流大模型在选择成本最优执行方案时频繁失误。
  • TerminalWorld 报告显示,agent 任务失败时消耗的 token 显著多于成功时,二者相关系数达 -0.62,提示「试错成本」被普遍低估。

两篇工作分别从「模型自身规划不省钱」和「失败路径吞噬 token」两个角度,为本次基准观察提供了学术佐证。

完整方法与原始数据公开

作者已将完整测试方法、原始结果以及全部 10 个任务提示词开源在 GitHub,并在 useweckr.com/benchmark 上线可视化页面,供开发者复现与扩展实验。对于正在按 token 预算选型或搭建 agent 流水线的团队而言,这套基准提供了比厂商报价更具参考价值的成本视角。

信源