桃子桃子快讯
返回首页
研究论文

35B 编码模型 120 轮对比:KAT-Coder 效率领先

社区用户对 4 款 35B 级模型进行 agentic 编码测试,KAT-Coder-V2.5-Dev 以 29/30…

2026.07.28 · 周二3 分钟阅读

Reddit 用户 /u/IvGranite 应社区请求,发布了一份针对 35B 参数量级编码模型的 agentic 能力对比报告,共 120 轮测试。报告显示,经过后训练优化的 KAT-Coder-V2.5-Dev 在通过率上追平原版基座,但输入 token 仅为其一半,且在工具调用规范性上明显胜出。

测试设置

  • 模型:4 款 35B 级模型,包括两款原版(stock)基座、Ornith 与 KAT-Coder-V2.5-Dev。
  • 任务:6 项自评编码任务,每项 5 次重复。
  • 环境:基于自研 agent「Hermes」无头运行,使用 llama.cpp + llama-swap,单卡 5090,全部调用经 OTel 中转写入 SigNoz。
  • 采样:所有模型采用相同的解码参数,并开启 MTP。
  • 方法:预先登记假设,4 个模型 × 6 个任务 × 5 重复 = 120 轮;自评分数由 6 位「分析师」(跨 3 个模型家族)独立打分,作者对所有关键结论进行人工核验。

通过率与效率

  • KAT-Coder-V2.5-Dev:29 / 30,与最强 stock 基座并列第一,输入 token 约为对方一半。
  • Ornith:25 / 30,甚至低于其自身的原版基座。
  • Stock 基座 3.6:分析能力最强但 token 消耗最大;Stock 3.5 表现稳定。

六位分析师独立认为 KAT-Coder 的优势来自「工程纪律」:修改前先跑基线、每 bug 一次定向补丁、产物始终落在正确路径;并非靠偷工减料取胜。

工具调用与失败模式

  • KAT-Coder-V2.5-Dev:30 轮中未出现格式错误的工具调用泄露。
  • Stock Qwen3.6 35B:在某项任务中泄露 195 次格式错误。
  • Ornith:失败集中在「机制」层面而非知识层面:
    • 格式泄露导致运行在 23 秒时直接中断。
    • 整文件重写时误伤无关文件。
    • 在一项研究任务中,模型自身推理中已写明「I mentioned v4659 in my draft which is fabricated」,却仍将该虚构的 llama.cpp 发布标签提交,自评环节也放行。

局限与说明

  • 任务采用自评方式,存在打分偏好风险。
  • 报告为个人博客(kmarble.dev)发布,未经过同行评审;作者已公开完整方法、表格与六段分析师逐任务点评。
  • 涉及的部分基座名称(如 Qwen3.5-35B、Qwen3.6)在公开版本中暂未对应到已知官方发布,读者引用时建议核对原始模型卡。

总体而言,这是 35B 这一档位上少数公开了完整方法与可追溯记录的后训练编码模型横评,对关注本地部署与代码 agent 的开发者具有参考价值。

信源