Pi搭配DeepSeek跑赢Claude Code,单任务成本仅其七分之一
Composio横向测试显示,DeepSeek V4 Flash在Pi Harness上任务通过率达66.7%,超Cla…
Composio 公司近日对 DeepSeek V4 Flash 在 8 种智能体 Harness 中的表现进行了公开横向测试。结果显示,轻量级方案 Pi Agent 以 66.7% 的任务通过率位居榜首,而同样使用该模型的 OpenCode 通过率仅为 46.7%,两者相差整整 20 个百分点;Claude Code 也仅通过 16 项。与此同时,Pi 的单任务平均成本约为 Claude Code 的七分之一。这一结果再次印证了所谓的「Harness 乘数效应」——围绕模型搭建的工具链,会显著放大或削弱同一款模型的真实表现。
测试结果:同一模型,差距悬殊
Composio 选取 DeepSeek V4 Flash,让其分别运行在 Pi Agent、Oh My Pi、Claude Code、Codex、Deep Agents、Prime Agent、Hermes Agent、OpenCode 共 8 种智能体 Harness 中,每种 Harness 各自运行 30 次,完成 30 项高难度智能体任务。
主要成绩如下:
- Pi Agent:通过 20 项,成功率 66.7%,排名第一
- Oh My Pi:通过 17 项,排名第二
- Claude Code、Codex、Deep Agents:均通过 16 项
- Hermes Agent:通过 15 项
- OpenCode:通过 14 项,排名最后
成本方面,Pi 平均完成一项成功任务仅花费 0.028 美元,Claude Code 需要 0.195 美元,接近前者的 7 倍。任务中位完成时间上,Pi 为 132.2 秒,略慢于 Claude Code 的 122.7 秒和 OpenCode 的 129.7 秒,但综合成功率、速度与成本三项指标,Pi 是本轮测试中表现最突出的方案。Composio 因此强调,不应孤立评测模型;如果一份 Agent 排行榜只写模型名称却没有交代使用了哪套 Harness,那么这个分数就是不完整的。
为何极简的 Pi 反而赢了
Pi 几乎未做额外配置,采用的是全新、未修改的默认安装,仅接入了测试所需的 MCP 服务器插件,正是这样一套接近开箱即用的方案最终通过了最多的任务。
相比之下,Prime Agent 产生了最为庞大的会话:部分会话消耗多达 350 万 Token,并进行 33 次工具调用。评分器仅为了处理这些会话就多次超时,导致 6 次运行未被计入成绩(2 次因评分器超时无法评分,4 次未留下记录)。即使只看有效运行,Prime 通过的任务数也与 Hermes 相当,但耗时接近 Pi 的两倍。
这组数据呈现出一个明显反差:功能与会话最庞杂的 Prime,被自身运行负担拖慢;更轻量的 Pi 以较低开销通过了最多任务。Pi Harness 创始人 Mario Zechner 的观点是:每增加一层,智能体就多了一个可能迷路的地方;每增加一个工具,它就多了一项需要做出的选择;干净的 Harness 能给模型提供一条从接收任务到完成任务的短路径。
99.9% 缓存命中率背后的工程优化
Pi 能把 DeepSeek 的使用成本压到极低,关键在于前缀缓存命中率。开发者 0xEvan 用 Pi 调用 DeepSeek V4 Flash 处理近 10 亿输入 Token,缓存命中率达 99.93%,最终只花了 2.65 美元;而同等用量在无缓存情况下预计需要 132 美元。另一名开发者 Shantanu Goel 表示,DeepSeek V4 Flash 在其他 Harness 中缓存命中率通常只有 94%–97%,到了 Pi 中却能持续达到 99% 以上。
DeepSeek API 采用前缀缓存:只有请求开头的 Token 序列与上一次完全一致,服务端才会命中缓存。一旦前缀发生变化,其后大量 Token 就可能「连坐」失效。因此,每一轮请求前都应保持系统提示词、工具定义、对话历史的稳定。
围绕这一目标,社区已经形成多个优化项目:
- Reasonix:围绕 DeepSeek 前缀缓存设计的终端编程 Agent,核心原则是启动时注入稳定环境摘要、对过时工具输出进行剪枝清理、双模型模式下将执行模型与规划模型分别运行在独立且缓存稳定的会话中。
- DeepPi:将 Reasonix 的缓存优化方法移植到 Pi,调用 DeepSeek API 时缓存命中率稳定在 99.7%–99.9%。
- pi-deepseek-cache:采用分层(P0–P3)策略,在启动时冻结日期和当前工作目录以避免系统提示词漂移,并对压缩摘要做哈希缓存,确保相同历史输入始终复用字节一致的摘要结果。
降本效果非常直观:使用 deepseek-v4-flash 时,输入 Token 成本从每百万 0.14 美元降至 0.003 美元,降幅约 98%;deepseek-v4-pro 则从 3.00 美元降至 0.025 美元,降幅约 99%。
DeepSeek 官方 Harness 即将发布
值得注意的是,DeepSeek 官方至今尚未推出自家 Harness。但 8 月 11 日,「DeepSeek Harness 团队」微信公众号已完成注册,被外界视为产品即将正式发布的重要信号,产品内测也已启动。
官方 Harness 最核心的优势在于「原生适配」:第三方 Harness 只能通过公开 API 做逆向优化,而官方团队可与模型训练团队协同,让模型针对 Harness 的调用模式做针对性优化,Harness 也能利用模型内部的非公开信息。这种深度整合,是任何第三方都难以复制的。
