研究论文
Qwen3.8-27B vs Qwen3.6-27B:代理基准实测差距显著
Reddit 用户在自建代理基准上对比两款 27B 模型,新版本通过率 60%,旧版本仅 30%。
2026.08.16 · 周日约 2 分钟阅读
近日,Reddit 用户 @poppear 在 r/LocalLLaMA 板块发布了一组针对 Qwen 两款 27B 模型的代理能力(agentic)实测结果。测试基于意大利比萨大学的低层级操作系统考试题目,使用意大利语指令,要求模型完成 C++/x86_64 自定义内核代码的编写、编译,并在 QEMU 中实际启动与验证,通过/失败结果严格判定,不给部分分。
测试设置
- 推理框架:vLLM
- 量化方式:fp8 推理
- 上下文长度:256k
- KV 缓存精度:bf16
- Agent 配置:统一的 pi agent 流程
实测结果
在 10 道考题上:
- Qwen3.8-27B:通过 6 题,正确率 60%
- Qwen3.6-27B:通过 3 题,正确率 30%
新版本相比旧版本正确率翻倍,差距达到 30 个百分点。
解读与局限
该基准偏重低层级系统编程与跨语言(意大利语 → 代码)理解,对模型的指令跟随、代码生成与端到端调试能力要求较高。在完全相同的 agent 配置下,两款模型的差异主要反映其底层能力而非工具链差异。
不过需要指出几点:
- 数据来源为单一 Reddit 帖文,未给出完整题库、prompt 或日志,结果不可独立复现;
- 「Qwen3.8-27B」「Qwen3.6-27B」两个模型名并非通义千问已知的官方公开版本(官方目前公开的命名体系为 Qwen2.5、Qwen3 等),是否为内部版本、社区微调或假设性命名尚待核实;
- 样本量仅 10 题,统计波动较大,不宜作为全面能力结论。
整体而言,这是一则社区层面的轻量级评测分享,适合作为同类模型迭代效果的参考信号,但不应直接等同于官方 benchmark。
