桃子桃子快讯
返回首页
行业动态

Fireworks AI 实测:Agent 推理 99.6% 输入命中缓存,成本可压至原方案 1/15

Fireworks AI 公布 DeepSWE 测试数据,Astra 平台单任务成本仅 0.43 美元,约为对比方案的十…

2026.09.16 · 周三3 分钟阅读

AI 推理平台 Fireworks AI 近日在 X 平台披露了一组 agent 推理的成本实测数据:在其自研 DeepSWE agent 上分别接入自家 Astra 推理服务与 DeepSeek V4.1-Flash,最终单任务成本为 0.43 美元,相比对比方案的 6.52 美元下降了约十五分之一,且官方称输出质量相当。这条消息再次把 agent 推理的「经济学」问题摆到台面上。

关键数字:输入远多于输出,缓存吃掉大头

Fireworks AI 给出的数据呈现出一个反直觉的 token 结构:

  • 输入 token 与输出 token 之比为 174 : 1,agent 场景下的开销几乎全部来自输入侧。
  • 在全部输入 token 中,99.6% 命中了缓存(cache hits)。
  • 这部分缓存命中又占到整张账单(即总费用)的 60%。

换言之,agent 不停地把相同或近似的上下文反复塞进模型,而其中绝大多数其实早已躺在 KV cache 里。

为何成本差距如此悬殊

按 Fireworks AI 的口径,Astra 单任务 0.43 美元、对比方案 6.52 美元,价差超过 15 倍。官方并未公开完整计费模型,但从其强调的两个杠杆可以推断:

  • 缓存命中率:99.6% 的命中率意味着几乎所有重复 prompt 走的是缓存折扣价而非全价。
  • 输入/输出结构:推理平台的输入 token 定价通常低于输出 token,174 : 1 的比例让整体账单被大幅压低。

厂商同时强调「same quality」,即在 DeepSWE 这一基准上,Astra 与 DeepSeek V4.1-Flash 的任务结果质量相当。

几点需要留意的局限

这是 Fireworks AI 官方账号以「推广自身服务」的口径发布的数据,读者在参考时应注意:

  • 「质量相当」未公开评测细节,缺乏并列打分或盲测。
  • DeepSWE 是 Fireworks 自家发布的 agent 测试基准,独立复现样本有限。
  • 缓存命中与定价高度依赖服务方实现,不同平台的「命中」定义未必一致。

对 agent 开发者的启示

即便折扣存在营销成分,结论对工程实践仍有方向性意义:在长上下文、高重复 prompt 的 agent 工作流里,推理平台是否提供透明且低价的 prompt cache,比单纯的「模型价格表」更直接地决定单任务成本。下次比价时,不妨先问一句:对方给我的 prompt 缓存折扣,到底是多少。

信源