桃子桃子快讯
返回首页
研究论文

Qwen3.8-27B vs Qwen3.6-27B:代理基准实测差距显著

Reddit 用户在自建代理基准上对比两款 27B 模型,新版本通过率 60%,旧版本仅 30%。

2026.08.16 · 周日2 分钟阅读

近日,Reddit 用户 @poppear 在 r/LocalLLaMA 板块发布了一组针对 Qwen 两款 27B 模型的代理能力(agentic)实测结果。测试基于意大利比萨大学的低层级操作系统考试题目,使用意大利语指令,要求模型完成 C++/x86_64 自定义内核代码的编写、编译,并在 QEMU 中实际启动与验证,通过/失败结果严格判定,不给部分分。

测试设置

  • 推理框架:vLLM
  • 量化方式:fp8 推理
  • 上下文长度:256k
  • KV 缓存精度:bf16
  • Agent 配置:统一的 pi agent 流程

实测结果

在 10 道考题上:

  • Qwen3.8-27B:通过 6 题,正确率 60%
  • Qwen3.6-27B:通过 3 题,正确率 30%

新版本相比旧版本正确率翻倍,差距达到 30 个百分点。

解读与局限

该基准偏重低层级系统编程与跨语言(意大利语 → 代码)理解,对模型的指令跟随、代码生成与端到端调试能力要求较高。在完全相同的 agent 配置下,两款模型的差异主要反映其底层能力而非工具链差异。

不过需要指出几点:

  • 数据来源为单一 Reddit 帖文,未给出完整题库、prompt 或日志,结果不可独立复现
  • 「Qwen3.8-27B」「Qwen3.6-27B」两个模型名并非通义千问已知的官方公开版本(官方目前公开的命名体系为 Qwen2.5、Qwen3 等),是否为内部版本、社区微调或假设性命名尚待核实;
  • 样本量仅 10 题,统计波动较大,不宜作为全面能力结论。

整体而言,这是一则社区层面的轻量级评测分享,适合作为同类模型迭代效果的参考信号,但不应直接等同于官方 benchmark。

信源