桃子桃子快讯
返回首页
行业动态

Qwen 27B 本地实测 Aider 跑分 72.9,追平 Gemini 2.5 Pro

Reddit 用户用 vLLM 在本地 MacBook 上跑 Qwen 27B(FP8),Aider 得分 72.9,与…

2026.08.24 · 周一2 分钟阅读

一名 r/LocalLLaMA 社区用户日前使用 vLLM 框架,在本地 MacBook 上对 Qwen 27B(FP8 量化、FP8 KV 缓存、256K 上下文)运行了 Aider 编码基准测试,最终得分为 72.9。该成绩与 2025 年 4 月 12 日版本的 Gemini 2.5 Pro 完全持平,并高于 2025 年 5 月 25 日的 Claude Opus 4(72.0),同时也高于 2025 年 6 月 6 日的 DeepSeek R1(71.4)。

跑分细节与对比

  • 测试模型:Qwen 27B,FP8 精度
  • 推理框架:vLLM,FP8 KV 缓存,上下文长度 256K
  • Aider 得分:72.9
  • 同分参照:Gemini 2.5 Pro(2025-04-12)72.9
  • 被超越对象:Claude Opus 4(2025-05-25)72.0;DeepSeek R1(2025-06-06)71.4

社区视角的解读

原帖作者坦言,Aider 是一项较老的基准,成绩存在一定偶然性。但他强调,能够在 MacBook 上以本地推理的方式复现约一年前顶级闭源模型的水平,对开源/本地部署社区而言仍是令人意外的结果。

关于实际能力的补充

作者还提到,如果使用更完善的推理脚手架(例如他近期在尝试的 DeepSeek Harness),模型在多轮推理下「几乎能解决 Aider 全部测试用例」,尽管平均对话轮数会超过 2 轮。这意味着上述 72.9 的单次跑分可能并未完全反映该模型在编程任务上的真实上限。

需要注意的局限

本次结果来自单一用户的本地测试,并非官方发布或独立机构复现,且未给出完整的环境配置、可复现脚本或多次取平均等统计信息。读者在引用该分数时应将其视为社区参考,而非经过验证的官方基准。

信源