Qwen 3.8 27B 智能指数获 52 分,追平更大参数模型
Qwen 3.8 27B 在 Artificial Analysis 智能指数上取得 52 分,与 GPT-5.6 Lu…
Qwen 团队最新模型 Qwen 3.8 27B 在第三方基准 Artificial Analysis Intelligence Index 上取得 52 分的成绩,与更大参数规模的同类模型处于同一档位,引发业内关注。该结果由知名 AI 博主 Simon Willison 在个人博客中转引公布,原文信息较为精简,但已勾勒出值得关注的能力对比。
基准成绩与横向对比
Artificial Analysis Intelligence Index 是综合多类任务的智能水平基准,分数常被用于横向比较不同模型的综合能力。Qwen 3.8 27B 在该指数上拿到 52 分,主要参照点如下:
- 与 GPT-5.6 Luna(max 配置)持平,同为 52 分;
- 落后 GLM-5.2(max 配置,753B 参数)1 分;
- 落后 DeepSeek V4 Pro 0813(max 配置)1 分。
从参数量来看,Qwen 3.8 27B 与 GLM-5.2 的 753B 相差超过一个数量级,GPT-5.6 Luna 与 DeepSeek V4 Pro 0813 的具体规模未在原文中披露,但原文作者推测 Luna 的实际参数量远高于 27B。需要说明的是,原帖给出的 DeepSeek 参数量为 1.6B,与 GLM 的 753B 形成显著反差,可能存在单位或表述差异,建议读者以 Artificial Analysis 官方数据为准。
小尺寸模型为何值得重视
在大模型竞争从「规模竞赛」逐步转向「效率竞赛」的当下,27B 级别模型能在综合智能指数上逼近 GLM-5.2、GPT-5.6 Luna 等大参数模型,意味着:
- 部署门槛显著降低,可在单卡或小型集群上运行;
- 单位算力下的推理成本更优,对中小团队与本地化场景更友好;
- 验证了 Qwen 系列在训练配方、蒸馏或架构上的阶段性进展。
原作者用「truly astonishing」形容这一成绩,反映了 27B 级别模型在大模型主流基准上的表现已超出以往预期。
信息来源与待补充细节
本次成绩由 Simon Willison 博客转引 Hacker News 讨论,原始数据来源为 Artificial Analysis。原帖未披露 Qwen 3.8 27B 的上下文窗口、是否采用特殊推理配置、子项得分构成以及发布日期等关键信息。如需进一步对比,建议直接查阅 Artificial Analysis 官方页面以获取完整 benchmark 拆解与方法说明。
