Qwen3.6 27B 量化横评:GGUF 在质量–体积权衡上整体领先
作者对 Qwen3.6 27B 的 16 种量化方案做 KL 散度对比,结果显示 GGUF 普遍优于 vLLM 系量化,…
LocalLLaMA 社区用户 Hefty_Wolverine_553 发布了一项针对 Qwen3.6 27B 的量化方案对比评测,覆盖 GGUF(llama.cpp)与 NVFP4、AWQ、AutoRound、FP8(vLLM)共 16 个量化版本。评测以未量化的 BF16 参考模型为基准,逐 token 计算 KL 散度,数值越低代表与原模型的概率分布偏离越小。整体来看,GGUF 在「每个 GiB 的质量」上占据 Pareto 前沿;Sakamakismile 出品的 NVFP4(W4A4)则在同体积级别里 KL 散度明显偏高。
评测背景与方法
作者使用自己构建的数据集:100 段结构化 agent 工具调用对话,共 182,306 个 token,单段 prompt 长度在 1,700–1,950 token 之间。评测时未对任何量化检查点做配置改动,包括计算 dtype、激活量化与 KV cache 方案,以反映各量化方案的「真实保真度」。KL 散度计算基于每个位置的前 200 个 logit 概率,求取与两个 top-200 列表及其剩余概率预算一致的下界。
GGUF:质量–体积权衡最优
参与对比的大多数 GGUF 量化都落在散点图的下方包络线上,意味着在同一权重体积下,运行在 llama.cpp 中的 GGUF 量化通常拥有最低的 KL 散度。作者认为主要原因在于 GGUF 不对激活进行量化,而多个 vLLM 检查点同时量化了权重、激活乃至 KV cache。
vLLM 量化结果参差不齐
相近体积的 vLLM 量化在保真度上差异显著:
- Bartowski Q4_K_L:0.2218
- Unsloth UD_Q4_K_XL:0.2273(两者区间高度重叠)
- AWQ:0.2776
- NVIDIA 混合 NVFP4:0.2807
其中 Sakamakismile 出品的 NVFP4(W4A4)相较于体量相近甚至更小的方案,KL 散度明显更高,是本次对比中的异常点。
关键术语说明
KL 散度衡量的是量化模型下一 token 概率分布相对参考分布的偏离程度,0 表示无变化,数值越大表示越多参考分布的概率质量被「挪走」。Top-1 一致率作为独立补充检查,不依赖尾部近似,结果与 KL 结论方向一致。参考分布在 top-200 之外的尾部质量本次均值为 0.0025。
实际选型启示
- 仅看量化格式不足以判断质量,还需看具体量化配方。
- 激活量化可在支持的硬件上提升吞吐,但会以质量为代价。
- 若优先关注「每加载 GiB 的质量」,本次测试中的 GGUF 配方是最强的折中选择。
- 从结果看,Qwen3.6 27B 的 GGUF Q5 是质量–体积上的甜点档位。
局限性
作者在结尾提醒:KL 散度可以反映量化方案之间的相对差异,但并不能完美映射到实际推理表现;结论仅适用于本次测试的配方组合,并非对 GGUF、AWQ、FP8、NVFP4 这些格式本身的通用排名。尺寸测量包含 MTP/NextN 层但排除 KV/循环缓存、激活、工作区等,并不等同于真实部署下的总显存占用。
