桃子桃子快讯
返回首页
研究论文

社区测试:Qwen3.8 27B 在 oneshot 任务上略优于前代

Reddit 用户在 oneshotlm 基准上对比 Qwen 27B 三个版本,评分从 2.46 提升至 3.00。

2026.08.15 · 周六2 分钟阅读

近日,Reddit 社区 r/LocalLLaMA 用户 kms_dev 发布了一组针对 Qwen 系列 27B 规模模型的 oneshot 能力对比测试。作者在 oneshotlm 提供的 35 个 oneshot 提示词上,分别运行了 Qwen3.5 27B、Qwen3.6 27B 与 Qwen3.8 27B 三个版本,并使用 Claude 系列模型(Sonnet 5)对生成结果进行打分。

测试设置与评分方法

  • 测试基准:oneshotlm,共 35 道 oneshot 任务提示词。
  • 参评模型:Qwen3.5 27B、Qwen3.6 27B、Qwen3.8 27B。
  • 评分方式:使用 Sonnet 系列模型作为裁判,对各模型的输出进行打分。

主要结果

  • 三个版本在 35 个任务上的平均评分依次为 2.46 → 2.74 → 3.00,呈逐代小幅上升趋势。
  • 在 2048 游戏复现任务上,Qwen3.6 27B 未生成出可运行版本,而 Qwen3.8 27B 可以完成。
  • 在图像绘制类任务中,Qwen3.8 27B 生成的「鹈鹕」形象更准确;Wolfenstein 场景下,Qwen3.8 27B 能画出大致轮廓,而 Qwen3.6 27B 几乎无法输出有效画面。

局限与说明

  • 该测试为社区个人行为,非官方发布,样本量与任务覆盖有限。
  • 文中出现的「Qwen3.5 / 3.6 / 3.8 27B」以及「Sonnet 5」等命名与目前公开的官方版本号并不一致,可能为社区俗称或笔误,读者参考时需注意。
  • 评分依赖单一 LLM 裁判,存在主观偏差风险,结果仅作为社区参考。

总体而言,这是一项小规模的社区横评,数据点有限,结论的统计意义不强,但反映出 27B 规模 Qwen 衍生版本在 oneshot 任务上可能存在轻微的代际改进。

信源