桃子桃子快讯
返回首页
研究论文

Artificial Analysis 完成 Qwen 3 低/中推理档位独立基准

Artificial Analysis 测评 Qwen 3 Low 与 Medium 档位,成绩强劲,证此前表现并非依赖…

2026.08.22 · 周六2 分钟阅读

独立 AI 基准平台 Artificial Analysis 近日对 Qwen 3 的「低(Low)」与「中(Medium)」两个推理档位进行了基准测试,相关成绩在 r/LocalLLaMA 社区引发关注。原帖发布者表示,两档配置的成绩「crazy good」,并指出这一结果进一步证明 Qwen 3 系列此前的亮眼表现,并非单纯由「overthinking」(过度推理 / 过长思考链)所驱动。

测评背景

Qwen 3 系列模型支持在不同推理强度之间切换,Low 与 Medium 即为其中的两档配置,对应不同的思考 token 预算。此前部分讨论认为,Qwen 3 在 Artificial Analysis 等平台上取得的高分,部分原因是其推理阶段使用的 chain-of-thought token 远超同类模型,从而出现「以算力换成绩」的解读。

核心结论

  • 测评机构:Artificial Analysis,独立第三方基准平台,在开源社区与行业研究中具备较高参考度;
  • 测评对象:Qwen 3 Low、Qwen 3 Medium 两个推理档位配置;
  • 主要发现:即便在不开到最大思考强度的设定下,Qwen 3 依然能取得出色基准成绩,说明其能力并非单一依赖思考长度。

对开发者的启示

该结论对使用 Qwen 3 开源权重进行本地部署或应用集成的开发者具有参考意义:在延迟敏感或成本敏感的场景中,可以选择 Low / Medium 推理档位,而不必为追求极限分数承担过高的算力开销。完整基准数据可前往 Artificial Analysis 官网及 r/LocalLLaMA 原帖查阅。

信源