桃子桃子快讯
返回首页
开源

QUASAR 团队发布 Qwen3.8-27B 全量化 NVFP4 权重

QUASAR 团队基于自研量化感知蒸馏算法 QUASAR QAD,发布 Qwen3.8-27B 的 NVFP4 全量化版…

2026.08.26 · 周三3 分钟阅读

QUASAR 团队近日在 r/LocalLLaMA 社区发布了一款针对 Qwen3.8-27B 的全量化 NVFP4 权重,模型经过 2,446 步量化感知蒸馏(QAD)训练,采用团队自研的 QAT 算法 QUASAR。蒸馏的教师模型为原始 BF16 版本,蒸馏后的 NVFP4 checkpoint 在体积大幅压缩的同时,多项基准成绩接近原版 BF16 精度。该模型已支持 vLLM 在 NVIDIA Blackwell GPU 上部署。

量化方案:覆盖全部线性层

该版本采用激进的 W4A4 量化配置,即所有 transformer block 中的 linear 层全部量化到 NVFP4 精度。通常情况下,Attention 层和 GDN(Gate-Delta Net)层会保留 FP8 或 BF16 精度,否则会带来明显的质量损失。但 QUASAR 通过量化感知蒸馏,让这些敏感层在 NVFP4 下仍能维持接近 BF16 的表现,这是本次发布的关键技术差异点。

基准对比:体积更小,精度接近

在 GPQA-Diamond(n=396,2 次均值)与 AIME26(n=90,3 次均值)两个基准上,QUASAR 版本的成绩如下:

  • 原版 BF16 Qwen3.8-27B(55.6 GB):GPQA-Diamond 0.9141,AIME26 1.0000
  • QUASAR-QAT/Qwen3.8-27B-QUASAR-NVFP4(19.7 GB):GPQA-Diamond 0.9091,AIME26 1.0000
  • unsloth/Qwen3.8-27B-NVFP4(23.4 GB):GPQA-Diamond 0.8939,AIME26 0.9778
  • Inferact/Qwen3.8-27B-NVFP4(26.4 GB):GPQA-Diamond 0.8763,AIME26 0.9667

可以看到,QUASAR 的全量化版本在体积缩小约 65% 的情况下,GPQA-Diamond 仅比 BF16 原版低 0.005,AIME26 与原版持平;与同样量化到 NVFP4 的 unsloth、Inferact 版本相比,QUASAR 在两个基准上均更高。

部署方式

在 Blackwell GPU 上,可通过 vLLM 直接加载该权重:

  • 仓库路径:QUASAR-QAT/Qwen3.8-27B-QUASAR-NVFP4
  • 推荐参数:--max-model-len 262144--gpu-memory-utilization 0.85

研究背景

团队同时提供了论文链接(arXiv:2608.13966v1),详细介绍 QUASAR 算法在 NVFP4 量化下的设计与实验。QUASAR-QAT 表示希望社区在 Blackwell 平台上对该 checkpoint 进行更多反馈与测试。

信源