Qwen3.8-27B 混合精度 EXL3 量化发布:KL 散度低于 NVFP4 92%
社区作者发布 Qwen3.8-27B 混合精度 EXL3 量化版本,在全词表 KL 散度评测中较 Unsloth NVF…
社区量化作者 malaiwah 发布了 Qwen3.8-27B 模型的混合精度 EXL3 量化版本,并在 BF16 参考分布下做了全词表 KL 散度评测。结果显示,该方案在保真度上显著优于官方 FP8 与 Unsloth NVFP4,且占用显存更低。
核心数据
作者使用同一套评测协议对比了三组方案与 BF16 之间的 KL 散度(KLD),结果如下:
- 混合精度 EXL3(K5/K6):常驻权重 20.31 GiB,Mean KLD 0.007406,Top-1 一致率 97.19%
- 官方 Qwen FP8:常驻权重 28.51 GiB,Mean KLD 0.013126,Top-1 一致率 96.22%
- Unsloth NVFP4:常驻权重 21.34 GiB,Mean KLD 0.094978,Top-1 一致率 90.53%
按此结果,EXL3 版本相对 Unsloth NVFP4 的 KLD 低约 92.2%,即 NVFP4 的散度约为 EXL3 的 12.8 倍;相对官方 FP8 低约 44%,而常驻权重体积约为 FP8 的 71%,比 NVFP4 也小约 1 GiB。
评测方法
作者在原帖中列出了完整的评估协议:
- 136 个评测上下文,278,392 个评分位置
- 计算完整词表级 KL(BF16 ‖ candidate),未做 top-k 近似
- 使用相同的 tokenizer、上下文与评分位置
- 进行两轮评测,body-only 比较共享 BF16 LM head
- 使用 source-cluster bootstrap 置信区间
重要运行时限制
该量化产物属于自定义运行时产物,无法在以下主流框架中直接加载:上游 vLLM、SGLang、TensorRT-LLM、Transformers、llama.cpp 或原版 ExLlamaV3。必须使用 local-inference-lab/vllm 仓库的 gilded-gnosis 分支,并按各模型卡中固定的 eager-mode 服务命令启动。
作者说明与解读
作者明确指出,KLD 衡量的是量化后模型 token 分布与 BF16 参考模型的接近程度,是量化保真度指标,而非下游推理或智能水平的直接评测,本次对比也不应被泛化到所有 NVFP4 方案。
作者在 32 GB 显存的 RTX 5090 上对 GPQA Diamond 做了主观测试,未感知到与原模型结果的显著差异。该模型变体发布于前一日,量化产物为首批出炉版本。作者认为更低的 KLD 通常意味着对原模型保真度的更好保留,从而在多数基准与实际使用中保留原模型的「智能」。
相关模型集合已在 Hugging Face 公开:malaiwah/qwen38-27b-mixed-precision-exl3-measured。
