桃子桃子快讯
返回首页
行业动态

社区讨论:Qwen3.8 27B 为何默认开启 xhigh 推理

Reddit 用户推测 Qwen 团队将 xhigh 设为默认推理档,是为了在 Artificial Analysis…

2026.08.18 · 周二2 分钟阅读

Qwen3.8 27B 发布后,社区注意到该模型将 xhigh 推理档设为默认参数,而非更常见的 balanced 或 low 档。Reddit 用户 frontsideair 在 r/LocalLLaMA 发文,给出了一种解释:这并非刻意刷榜,而是面对第三方基准评测平台时的一种务实选择。

为何选择默认 xhigh

发帖者认为,主流第三方基准(如 Artificial Analysis)在测试开源模型时,往往仅以模型出厂默认设置运行一次,而非遍历全部推理档位。相对而言,头部实验室的闭源模型会在多个推理档位下分别测试,以呈现完整能力曲线;而开源模型「能拿到一次评测机会就已经不错」,以 Laguna S 2.1 为例。

因此,Qwen 团队选择在默认档上呈现模型最强推理能力,逻辑上就讲得通:既然大概率只有「一次机会」被评测,不如直接亮出上限。

这算不算刷榜

发帖者明确表示,并不认为 Qwen 团队存在 benchmaxxing 行为。理由有三:

  • xhigh 是一个真实可用的档位,需要更高带宽或更长时延才能跑得动,并非仅为测试设计的「作弊开关」;
  • 可变推理档位(variable reasoning)在当前主流模型中已是标配,用户可按需切换;
  • 如果团队确信自己拿不到多档位评测机会,那么把最强档作为默认,是合理的商业判断。

评测机制的不对称问题

该讨论实际上折射出一个更深层的行业现象:开源模型在第三方评测体系中处于弱势地位。闭源旗舰可以被反复、多维度测评,而开源模型往往只有「出厂默认」这一次亮相机会。这一不对称既影响模型声誉,也间接塑造了开源团队的产品决策——在权衡用户体验与基准表现时,后者往往不得不让步。

目前 Qwen 团队尚未对此说法作出官方回应,相关讨论仍在 r/LocalLLaMA 评论区延续。

信源