Pi 与 DeepSeek Harness 同模型基准对比:Pi 小幅领先但样本有限
在 Qwen3.8-27B 本地模型上,Pi 以 6/8 通过率领先 DeepSeek 官方 Harness 的 4/8…
在 Qwen3.8-27B 同一本地模型上,第三方编码代理框架 Pi 与 DeepSeek 官方发布的 Harness(DSH)完成了一轮编码任务基准对比。结果显示 Pi 在外部检查器评估中以 6/8 通过率领先 DSH 的 4/8,平均得分 0.825 对 0.680;但整组实验仅 4 个任务、每任务 2 次试验,区分两者的全部差异实际只来自单一任务,样本不足以支撑通用排名结论。
基准设置
测试在 Qwen3.8-27B 本地推理上分别运行 Pi 0.73.1 与 DSH 0.1.1-rc.2(后者固定到 deepseek-ai/deepseek-harness 的 dsh-v0.1.1-rc.2 版本,commit b150a55,MIT 许可)。四个任务为 make-ci-green、add-feature、taskflow、webcore,每任务两轮,共 16 次运行,每轮设有 1,200 秒的统一上限。DSH 默认模型为 deepseek-v4-flash,本次通过自定义本地路由(@deepseek-ai/dsh-llm-pi-ai 适配器)替换为 Qwen3.8-27B。
关键数据
- 外部检查通过:Pi 6/8(75%),DSH 4/8(50%)
- 平均外部得分:0.825 对 0.680
- 配对胜 / 负 / 平:Pi 2 / 0 / 6,DSH 0 / 2 / 6
- 总耗时:Pi 6,455.5 s,DSH 7,356.5 s(DSH 多 14.0%)
- 首 token 时延均值:Pi 31.40 s,DSH 38.87 s(DSH 慢 23.8%)
- 聚合生成吞吐:Pi 12.74 tokens/s,DSH 11.38 tokens/s
- 完成响应输出 token:Pi 26,587,DSH 30,520(DSH 多 14.8%)
任务级拆分
四个任务里有两组对两个框架都满分:make-ci-green 与 add-feature 均为 2/2;一个对两者都是 0/2:webcore(双方均未修改文件)。真正区分两者的是 taskflow:Pi 两轮均通过(1.00、1.00),DSH 两轮均因 1,200 秒超时被中断,得分 0.28 和 0.56。换言之,全部通过率与均分差距几乎完全由这一个任务贡献。在四个双方均通过的任务里,Pi 每轮比 DSH 快 144.3 至 291.8 秒。
局限与说明
原文明确强调四点限制:四个任务、两次试验、仅两个非平局配对,样本过小,不能支撑统计意义上的排名或胜出声明;DSH 仍是 RC / 开发者预览版本,行为与配置可能快速变化;floor 任务(webcore)的存在说明并未针对 Pi 倾向挑选测试用例;该结论仅适用于本次测量样本与成本 / 延迟观察,不可外推为对 Pi 的通用排名。本研究是此前 Pi vs. Prime 对比的独立后续,不替代亦不修改既有结论。
