桃子桃子快讯
返回首页
行业动态

Qwen3.8-27B AIME 2026 实测:FP8 量化 29/30,速度近翻倍

用户在 AIME 2026 上实测 Qwen3.8-27B:FP8 + xhigh 推理达到 29/30(96.7%),…

2026.08.21 · 周五4 分钟阅读

一位社区用户在 r/LocalLLaMA 发布了对通义千问 Qwen3.8-27B 的实测结果。测试在 MathArena/aime_2026 数据集上进行,对比 BF16 与 FP8 量化权重在 medium 与 xhigh 两档推理设置下的表现。结论是:FP8 量化 + xhigh 推理的正确率达到 29/30(96.7%),与 BF16 + xhigh 持平,但预填充与解码速度显著更高。

核心发现

  • FP8 xhigh 的正确率与 BF16 xhigh 一致(均为 29/30,96.7%),同时吞吐量更高;
  • FP8 medium 档正确率为 26/30(86.7%),低于 BF16 medium 的 28/30(93.3%),说明在中等推理档下量化会带来可察觉的精度损失;
  • 第 7 题中,BF16 xhigh 与 FP8 xhigh 均耗尽了完整的上下文 token 生成预算,最终未产出答案,因此这两例属于「空白」而非「错误」。

详细成绩与吞吐

模型设置正确率最大 token预填充 tk/s解码 tk/s
BF16 · medium28/30(93.3%)58,7471.9K28
BF16 · xhigh29/30(96.7%)258,0481.928
FP8 量化 · medium26/30(86.7%)75,0243.4K76
FP8 量化 · xhigh29/30(96.7%)258,0483.4K76

注:BF16 xhigh 的预填充吞吐作者记录为 1.9 tk/s,与 medium 档差异巨大,原文未给出进一步解释。FP8 量化版在 xhigh 档的预填充(3.4K tk/s)与解码(76 tk/s)吞吐约为 BF16 同档的近两千倍与 2.7 倍。

评测设置

  • 数据集:MathArena/aime_2026(revision d2de22f3c656b4f56cf8981212186377d1e23bc3);
  • 评分方式:Exact-match;
  • 采样:禁用(greedy / temperature 0);
  • 并发:BF16 为 4,FP8 为 7;
  • 各次运行的对话模板与提示格式保持一致。

作者特别说明:AIME 2026 数据集第 7 题存在「上下文耗尽而无输出」的情况,按评测规则记为 0 分,但并非模型逻辑判断错误。

与前沿模型横向对比

作者将其单次 pass@1 结果与公开榜单进行对照(其它模型多为多次取平均):

  • GPT-5.6 Sol, xhigh:99.9%
  • GLM-5.2:99.2%
  • GPT-5.4, xhigh:99.2%
  • Gemini 3.1 Pro, high:98.3%
  • Inkling, effort 0.99:97.1%
  • Claude Opus 4.6, max:96.7%
  • DeepSeek V4 Pro:96.7%
  • Qwen3.8-27B FP8, xhigh(本次 pass@1):96.7%(29/30)
  • Kimi K2.6, thinking:96.4%
  • Qwen3.6-27B:94.1%

在 27B 参数量级、面向本地部署的模型中,Qwen3.8-27B FP8 + xhigh 的 96.7% 已与 Claude Opus 4.6、DeepSeek V4 Pro 等头部模型持平,并明显超过 Qwen3.6-27B。需要注意的是,其它模型多为多次平均,而本次为单次 pass@1,对比口径不完全一致。

实测意义

这次实测传递的主要信号是:Qwen3.8-27B 在 FP8 量化后并未在 xhigh 推理档出现可观测的精度损失,同时带来明显的吞吐提升——这对本地 GPU 部署的爱好者与中小团队具有直接参考价值。若以 medium 档追求速度,则需接受约 6.7 个百分点的准确率损失。

信源