行业动态
Qwen 27B 本地实测 Aider 跑分 72.9,追平 Gemini 2.5 Pro
Reddit 用户用 vLLM 在本地 MacBook 上跑 Qwen 27B(FP8),Aider 得分 72.9,与…
2026.08.24 · 周一约 2 分钟阅读
一名 r/LocalLLaMA 社区用户日前使用 vLLM 框架,在本地 MacBook 上对 Qwen 27B(FP8 量化、FP8 KV 缓存、256K 上下文)运行了 Aider 编码基准测试,最终得分为 72.9。该成绩与 2025 年 4 月 12 日版本的 Gemini 2.5 Pro 完全持平,并高于 2025 年 5 月 25 日的 Claude Opus 4(72.0),同时也高于 2025 年 6 月 6 日的 DeepSeek R1(71.4)。
跑分细节与对比
- 测试模型:Qwen 27B,FP8 精度
- 推理框架:vLLM,FP8 KV 缓存,上下文长度 256K
- Aider 得分:72.9
- 同分参照:Gemini 2.5 Pro(2025-04-12)72.9
- 被超越对象:Claude Opus 4(2025-05-25)72.0;DeepSeek R1(2025-06-06)71.4
社区视角的解读
原帖作者坦言,Aider 是一项较老的基准,成绩存在一定偶然性。但他强调,能够在 MacBook 上以本地推理的方式复现约一年前顶级闭源模型的水平,对开源/本地部署社区而言仍是令人意外的结果。
关于实际能力的补充
作者还提到,如果使用更完善的推理脚手架(例如他近期在尝试的 DeepSeek Harness),模型在多轮推理下「几乎能解决 Aider 全部测试用例」,尽管平均对话轮数会超过 2 轮。这意味着上述 72.9 的单次跑分可能并未完全反映该模型在编程任务上的真实上限。
需要注意的局限
本次结果来自单一用户的本地测试,并非官方发布或独立机构复现,且未给出完整的环境配置、可复现脚本或多次取平均等统计信息。读者在引用该分数时应将其视为社区参考,而非经过验证的官方基准。
