研究论文
社区测试:Qwen3.8 27B 在 oneshot 任务上略优于前代
Reddit 用户在 oneshotlm 基准上对比 Qwen 27B 三个版本,评分从 2.46 提升至 3.00。
2026.08.15 · 周六约 2 分钟阅读
近日,Reddit 社区 r/LocalLLaMA 用户 kms_dev 发布了一组针对 Qwen 系列 27B 规模模型的 oneshot 能力对比测试。作者在 oneshotlm 提供的 35 个 oneshot 提示词上,分别运行了 Qwen3.5 27B、Qwen3.6 27B 与 Qwen3.8 27B 三个版本,并使用 Claude 系列模型(Sonnet 5)对生成结果进行打分。
测试设置与评分方法
- 测试基准:oneshotlm,共 35 道 oneshot 任务提示词。
- 参评模型:Qwen3.5 27B、Qwen3.6 27B、Qwen3.8 27B。
- 评分方式:使用 Sonnet 系列模型作为裁判,对各模型的输出进行打分。
主要结果
- 三个版本在 35 个任务上的平均评分依次为 2.46 → 2.74 → 3.00,呈逐代小幅上升趋势。
- 在 2048 游戏复现任务上,Qwen3.6 27B 未生成出可运行版本,而 Qwen3.8 27B 可以完成。
- 在图像绘制类任务中,Qwen3.8 27B 生成的「鹈鹕」形象更准确;Wolfenstein 场景下,Qwen3.8 27B 能画出大致轮廓,而 Qwen3.6 27B 几乎无法输出有效画面。
局限与说明
- 该测试为社区个人行为,非官方发布,样本量与任务覆盖有限。
- 文中出现的「Qwen3.5 / 3.6 / 3.8 27B」以及「Sonnet 5」等命名与目前公开的官方版本号并不一致,可能为社区俗称或笔误,读者参考时需注意。
- 评分依赖单一 LLM 裁判,存在主观偏差风险,结果仅作为社区参考。
总体而言,这是一项小规模的社区横评,数据点有限,结论的统计意义不强,但反映出 27B 规模 Qwen 衍生版本在 oneshot 任务上可能存在轻微的代际改进。
