桃子桃子快讯
返回首页
产品功能

Anthropic官方支招:读懂token计费与缓存,少花冤枉钱

Anthropic发布博客详解Claude Code的token计费逻辑、缓存机制与对话膨胀问题,给出六条可操作的省钱建…

2026.08.16 · 周日6 分钟阅读

Anthropic 近日在其官网博客发布长文,系统拆解了 Claude Code 的 token 计费原理、缓存机制以及对话历史膨胀问题,并给出六条具体的省钱习惯。文章披露的数据显示,开发者日均消耗约 13 美元的 token,月均花费在 150 到 250 美元之间,同一任务仅因使用方式不同便可能产生数倍的成本差距。

token 的两段旅程:预填充与解码

在 Claude Code 中输入一条指令后,模型端实际发生两件事。

第一是「预填充(prefill)」:模型一次性并行读入整段请求,包括系统提示词、CLAUDE.md、用户消息以及此前对话中累积的所有内容,这部分构成输入 token。

第二是「解码(decode)」:模型逐字生成回复,包括思考过程、工具调用和最终呈现的文本,这部分构成输出 token。

两者在算力消耗上差异显著。预填充是并行的,一次性把全部输入 token 送入 GPU;解码则是串行的,每生成一个 token 都要完整跑一遍模型。200 个 token 的回复,意味着 200 次独立运算。也正因如此,输出 token 的单价通常是输入 token 的 5 倍。

以官方公布的价目为例:

  • Opus 5:输入 5 美元/百万 token,输出 25 美元/百万 token
  • Sonnet 5:输入 2 美元,输出 10 美元
  • Haiku 4.5:输入 1 美元,输出 5 美元

账单最终取决于两个变量:模型决定单价,推理强度(effort level)决定 token 数量。推理强度越高,模型思考越充分,产生的思考 token 也越多,最高与最低档之间相差数倍。

提示缓存:最大的省钱杠杆

Claude Code 每次请求都从相同的前缀开始:系统提示词、工具定义、CLAUDE.md 和对话历史。若本次请求的前缀与上次逐字节一致,服务器便直接复用上次的计算结果,不再重算。

缓存读取的价格仅为正常输入价的 0.1 倍,相当于直接省掉 90%。写入缓存的价格最高为正常输入价的 2 倍,但写入仅发生一次,后续每一轮都可按 0.1 倍读取。

举例而言,假设对话历史累积 5 万个 token:不走缓存时,每一轮都要按全价重新读取这 5 万 token;只要命中缓存,同样 5 万 token 的成本只有十分之一。一个会话跑二三十轮,累积节省的费用相当可观。

不过缓存有一个硬性约束——必须从请求的第一个字节开始连续匹配,中间任何变化都会导致从该处往后的缓存全部失效。Anthropic 列出了六种典型场景:

  • /model 切换模型:每个模型的缓存独立,切换后历史按新模型价格全量重算
  • /effort 切换推理强度:推理强度本身是缓存键的一部分,切换即失效
  • 开关 Fast mode:与上述两种效果一致
  • /compact 压缩对话:原文被改写为摘要,旧缓存作废
  • 时间过期:订阅用户缓存保活 1 小时,API 用户默认 5 分钟
  • 恢复旧会话:间隔过久缓存早已消失,几乎必然全价重算

另外,opusplan 模式每次进出 plan 都会切换模型,等同于两次缓存失效,反复进出时每一跳都是一笔全价预填充。

对话正在偷偷变胖

缓存把重复发送历史的成本压到十分之一,但它无法阻止历史本身不断膨胀。每次 Claude 读取文件,文件内容追加进对话;每次运行命令,输出也追加进对话。从追加的那一轮起,后面每一轮都会带着这些内容一起重新发送。

这种增长接近平方级——第 40 轮对话需要重新发送第 1 至 39 轮的全部累积内容。Claude Code 设有一道兜底机制:命令输出超过 30000 字符时不再塞入对话,而是写入临时文件并在对话中仅保留一句摘要。但 30000 字符以下的输出仍会原封不动留在历史里,例如一份打印 400 行通过信息的测试报告,总量不足 3 万便会完整保留,后续每一轮都随之重发。

针对这一现象,Anthropic 给出了几条瘦身方法:

  • @ 引用文件而非手打路径:附件式引用省去一次工具调用,也避免 Claude 先搜索再试探多个文件带来的额外开销
  • 给 noisy 命令加 quiet flag:在 CLAUDE.md 中配置例如 --reporter=dot,让测试只输出几行摘要而非几百行详情
  • 用 subagent 隔离大输出任务:subagent 在独立上下文窗口中运行,完成后只回传结论,适合日志排查、全文检索类工作
  • 修完任务立即 /clear:上一个任务的文件、命令输出与探索过程与下一个任务无关,不清理便会持续占用上下文
  • 必要时使用 /compact:可将一万至两万 token 的对话压缩到一千至三千 token,但注意在缓存仍热时压缩成本最低,仅为正常压缩的十分之一
  • 跑偏时可使用 /rewind:直接砍掉最后几轮,前面的缓存保持不动

管 token,也是开发者新素养

把这些操作放在一起可以看到,AI 时代的代码工作正在催生一种与框架和语言无关的新能力:知道该选什么模型、如何管理上下文、如何保住缓存、推理强度开多高合适。这些能力一年前并不存在,却已经决定同一个任务是花 3 美元还是 30 美元。

Anthropic 自身便是例证——其内部 80% 的代码由 AI 编写,代码合并量一年增长 8 倍,基准测试速度提升 52 倍。当 AI 使用强度达到这一量级,若没有人管理 token 成本,仅推理开销就足以吞噬预算。读懂这篇博客,薅到的不只是几美元的 token,而是同一笔预算下产出更多代码的可能。

信源