桃子桃子快讯
返回首页
工具

Gemma 4 QAT 版本在 KV cache 量化下表现显著优于非 QAT 版本

社区基于 BeeLlama.cpp 对 Gemma 4 31B 进行 QAT 与非 QAT 的 KV cache 量化对…

2026.08.12 · 周三3 分钟阅读

Google 发布的 Gemma 4 系列因其开放权重与较好的本地推理友好度受到社区关注。近日 r/LocalLLaMA 用户基于 BeeLlama.cpp(llama.cpp 的一个增强 KV cache 量化选项的分支)v0.4.3,对 Gemma 4 31B 的 Q4_0 QAT 与 Q4_0 非 QAT 版本进行了系统对比,结果显示 QAT 版本在 KV cache 量化场景下的表现明显更好。

测试方法

评测采用 Kullback–Leibler 散度(KLD)作为量化前后输出分布差异的度量,并统计 same-top 比例(即 top-1 token 与全精度参考一致的概率)。对比维度覆盖 q8_0、q6_0、q5_0、q4_0、q3_0、q2_0 共六档 KV cache 量化精度,每档同时给出非 QAT 与 QAT 的 KLD 均值与 same-top 比例。

关键数据

  • q8_0:KLD 由 0.3056 降至 0.0151,比值 20.3×;same-top 从 85.115% 升至 94.870%(+9.755 pp)
  • q6_0:KLD 由 0.4044 降至 0.0226,比值 17.9×;same-top 从 82.415% 升至 93.640%(+11.225 pp)
  • q5_0:KLD 由 0.5614 降至 0.0409,比值 13.7×;same-top 从 78.566% 升至 91.134%(+12.568 pp)
  • q4_0:KLD 由 0.8804 降至 0.0905,比值 9.7×;same-top 从 71.630% 升至 86.337%(+14.707 pp)
  • q3_0:KLD 由 1.7167 降至 0.2864,比值 6.0×;same-top 从 57.927% 升至 73.017%(+15.090 pp)
  • q2_0:KLD 由 4.1760 降至 1.0584,比值 3.9×;same-top 从 26.593% 升至 48.659%(+22.066 pp)

从 same-top 的整体水平看,非 QAT 版本在 q2_0 时已跌至 26.593%,意味着大多数回答的 top-1 token 已偏离参考模型;而 QAT 版本在同等精度下仍能保持 48.659%,作者形容为「看起来还像 Gemma 4」。

结论与意义

  • QAT 训练对 KV cache 量化的鲁棒性提升显著,且量化越激进,same-top 的相对收益(pp 差值)越大
  • 在低显存场景下部署 Gemma 4 时,优先选择 QAT 权重可在不显著增加体积的情况下保留更多输出质量
  • 该结论与此前社区在更小尺寸 Gemma 4 QAT 模型上的观察一致,说明 QAT 对 KV cache 量化的友好度具有跨尺寸的可迁移性

完整测试设置、方法论与原始数据见原文链接。需要注意的是,本次结果来自社区实测而非 Google 官方发布,解读时建议结合自身硬件与负载进行复测。

信源