Qwen3.8-27B AIME 2026 实测:FP8 量化 29/30,速度近翻倍
用户在 AIME 2026 上实测 Qwen3.8-27B:FP8 + xhigh 推理达到 29/30(96.7%),…
一位社区用户在 r/LocalLLaMA 发布了对通义千问 Qwen3.8-27B 的实测结果。测试在 MathArena/aime_2026 数据集上进行,对比 BF16 与 FP8 量化权重在 medium 与 xhigh 两档推理设置下的表现。结论是:FP8 量化 + xhigh 推理的正确率达到 29/30(96.7%),与 BF16 + xhigh 持平,但预填充与解码速度显著更高。
核心发现
- FP8 xhigh 的正确率与 BF16 xhigh 一致(均为 29/30,96.7%),同时吞吐量更高;
- FP8 medium 档正确率为 26/30(86.7%),低于 BF16 medium 的 28/30(93.3%),说明在中等推理档下量化会带来可察觉的精度损失;
- 第 7 题中,BF16 xhigh 与 FP8 xhigh 均耗尽了完整的上下文 token 生成预算,最终未产出答案,因此这两例属于「空白」而非「错误」。
详细成绩与吞吐
| 模型设置 | 正确率 | 最大 token | 预填充 tk/s | 解码 tk/s |
|---|---|---|---|---|
| BF16 · medium | 28/30(93.3%) | 58,747 | 1.9K | 28 |
| BF16 · xhigh | 29/30(96.7%) | 258,048 | 1.9 | 28 |
| FP8 量化 · medium | 26/30(86.7%) | 75,024 | 3.4K | 76 |
| FP8 量化 · xhigh | 29/30(96.7%) | 258,048 | 3.4K | 76 |
注:BF16 xhigh 的预填充吞吐作者记录为 1.9 tk/s,与 medium 档差异巨大,原文未给出进一步解释。FP8 量化版在 xhigh 档的预填充(3.4K tk/s)与解码(76 tk/s)吞吐约为 BF16 同档的近两千倍与 2.7 倍。
评测设置
- 数据集:MathArena/aime_2026(revision d2de22f3c656b4f56cf8981212186377d1e23bc3);
- 评分方式:Exact-match;
- 采样:禁用(greedy / temperature 0);
- 并发:BF16 为 4,FP8 为 7;
- 各次运行的对话模板与提示格式保持一致。
作者特别说明:AIME 2026 数据集第 7 题存在「上下文耗尽而无输出」的情况,按评测规则记为 0 分,但并非模型逻辑判断错误。
与前沿模型横向对比
作者将其单次 pass@1 结果与公开榜单进行对照(其它模型多为多次取平均):
- GPT-5.6 Sol, xhigh:99.9%
- GLM-5.2:99.2%
- GPT-5.4, xhigh:99.2%
- Gemini 3.1 Pro, high:98.3%
- Inkling, effort 0.99:97.1%
- Claude Opus 4.6, max:96.7%
- DeepSeek V4 Pro:96.7%
- Qwen3.8-27B FP8, xhigh(本次 pass@1):96.7%(29/30)
- Kimi K2.6, thinking:96.4%
- Qwen3.6-27B:94.1%
在 27B 参数量级、面向本地部署的模型中,Qwen3.8-27B FP8 + xhigh 的 96.7% 已与 Claude Opus 4.6、DeepSeek V4 Pro 等头部模型持平,并明显超过 Qwen3.6-27B。需要注意的是,其它模型多为多次平均,而本次为单次 pass@1,对比口径不完全一致。
实测意义
这次实测传递的主要信号是:Qwen3.8-27B 在 FP8 量化后并未在 xhigh 推理档出现可观测的精度损失,同时带来明显的吞吐提升——这对本地 GPU 部署的爱好者与中小团队具有直接参考价值。若以 medium 档追求速度,则需接受约 6.7 个百分点的准确率损失。
