MagicQuant 更新 Unsloth v3 量化流程,发布 Qwen3 27B 多档位 GGUF
MagicQuant 工具引入 Unsloth 动态量化 v3 与 imatrix,针对 Qwen3 27B 输出多档位…
MagicQuant 近日更新其 GGUF 混合发现工作流,集成 Unsloth 动态量化 v3 与 imatrix 校准,并以 Qwen3 27B 为对象产出了一组新的 GGUF 量化产物。本次更新同步在 HuggingFace 仓库公开,manifest 目录附带基准结果、可复现的克隆配置以及 v2 与 v3 之间的对比说明。
MagicQuant 是什么
MagicQuant 是一个由社区开发者维护的、以基准驱动的 GGUF 评估与混合发现系统。其工作流程是先消化并学习 Unsloth 等来源的 GGUF 张量配置,再将其中规律聚类、分组建独立的隔离测试,随后进入预测阶段,遍历一系列可能的混合组合,寻找有潜力的量化配方。最终产物中以「MQ」后缀命名的条目即为 MagicQuant 生成的混合配置,其余「UD-」前缀的条目则直接指向 Unsloth 的官方产物。
Qwen3 27B 量化结果概览
本次针对 Qwen3 27B 的运行被作者描述为一次「相对保守」的实验,重点在于比较 Unsloth 动态量化 v2 与 v3 的差异,并对 imatrix 进行分档重测。仓库公开了 KLD(KL 散度,越低表示与全精度输出越接近)与体积(GB)两列数据,覆盖从 Q8_0 到 IQ2_XXS 的多档位。
部分代表性条目如下:
- LM-Q8_0(llama.cpp 基线):KLD 0.000712,体积 29.05 GB
- MQ-Q6_K_1:KLD 0.000703,体积 29.03 GB
- MQ-Q6_K_2:KLD 0.000873,体积 27.26 GB
- MQ-Q6_K_3:KLD 0.001047,体积 25.94 GB
- UD-Unsloth-UD-Q6_K_XL:KLD 0.001238,体积 25.33 GB
- UD-Unsloth-UD-Q4_K_M:KLD 0.011205,体积 16.50 GB
- UD-Unsloth-UD-Q4_K_S:KLD 0.014502,体积 15.39 GB
- UD-Unsloth-UD-IQ4_XS:KLD 0.020127,体积 14.29 GB
- MQ-IQ2_M_1:KLD 0.057811,体积 11.96 GB
- MQ-IQ2_XXS_1:KLD 0.270304,体积 8.27 GB
从同档位对比看,MagicQuant 的混合配置在 Q6_K 与 Q5_K 区间普遍以更小的 KLD 换取相近或更小的体积;进入 Q4 及更低档位后,Unsloth 的官方产物与 MagicQuant 混合体各有优劣,整体差距随档位降低而放大。
v2 与 v3 的差异
作者特别指出,本次运行并非简单套用 Unsloth 既有模板,而是将动态量化流程升级到 v3,并在不同档位使用各自对应的 imatrix,而非一刀切。manifest 中同步披露了 v2 与 v3 的对照结论,便于复现与审计。
适用人群与局限
该仓库主要面向在本地消费级硬件上跑 Qwen3 27B GGUF 的用户,尤其是希望在保持可用精度的前提下尽可能压缩体积、对比不同量化策略效果的开发者与爱好者。需要注意的是,KLD 仅衡量与参考分布的统计距离,不能完全代表下游任务表现,实际选型仍需结合具体应用场景测试。
