开源
Qwen 3.8 27B 四档 GGUF 量化实测
团队实测 Qwen 3.8 27B 四档量化,AD-Q6_K 被视为更稳妥的选择。
2026.08.24 · 周一约 2 分钟阅读
一支团队制作了 Qwen 3.8 27B 的 Atomic Dynamic GGUF 量化版本,并在同一项体素岛屿生成任务中对不同量化方案进行了对比。测试显示,量化位阶越高,输出与 BF16 的差异越小,但文件体积增加,RTX PRO 6000 上的解码速度整体有所下降。团队据此将 AD-Q6_K 视为更稳妥的选择。
评测设置
测试比较了 4 个版本的模型文件大小、相对 BF16 的 top-1 指标、解码阶段平均 KLD 以及生成速度。发帖者表示,所有测试场景均由体素构成,Qwen 3.8 27B 对这类 3D 场景的总体处理效果较好。
实测数据
- AD-Q4_K_M:17.1 GB,top-1 为 95.6%,mean KLD 为 0.0113,解码速度为 67 tok/s。
- AD-Q5_K_M:20.2 GB,top-1 为 97.3%,mean KLD 为 0.0042,解码速度为 57 tok/s。
- AD-Q6_K:25.0 GB,top-1 为 98.7%,mean KLD 为 0.0011,解码速度为 49 tok/s。
- Q8_0:28.9 GB,top-1 为 98.9%,mean KLD 为 0.0006,解码速度为 50 tok/s。
其中,AD-Q4_K_M 的体积最小、速度最高,但与 BF16 的差异也最明显。Q8_0 的精度指标最高,AD-Q6_K 则以更小体积取得了接近 Q8_0 的结果。
结论与边界
测试团队认为,各版本生成的场景整体较为相似,差异并不十分显著,并表示部分结果中更偏好 AD-Q4_K_M 的输出。若优先考虑与 BF16 接近,他们推荐 AD-Q6_K;相关量化文件已在 Atomic Chat 和 Hugging Face 提供下载。
不过,这是一项基于单一任务、单一 GPU 和单一输出观察的社区测试。原文没有披露具体提示词、运行参数、重复次数或多次运行结果,因此数据更适合作为特定硬件环境下体积、速度与相似度取舍的参考,不宜视为完整模型能力评测。
