工具
Gemma 4 E4B 极低比特量化:推理能力恢复 96.74%
社区用户在 IQ2_XXS 档位下通过张量级精度分配,把 Gemma 4 E4B 推理从 28.9 拉回 69.5,保留…
2026.08.15 · 周六约 3 分钟阅读
Reddit 用户 ByteOtter 在 r/LocalLLaMA 社区发布了一项针对 Gemma 4 E4B 模型的极低比特量化实验结果。该实验在保持约 3.3 GiB 模型体积的前提下,通过张量级精度分配(tensor-level allocation)配合类别化 imatrix,将模型的推理得分从严重坍塌的 28.9 恢复到 69.5,相对提升达到 +140.54%。
实验背景与方法
作者此前已在 Gemma 4 12B 上验证过张量级精度分配的效果,相比 imatrix 基线取得 +8.55% 的相对改进。本次实验进一步将精度压到 IQ2_XXS 等级,这是当前最激进的量化档位之一,原始 imatrix 模型在该精度下几乎丧失推理能力。
方法核心步骤如下:
- 用面向类别的语料构建 imatrix
- 测量各能力维度在量化后的损失程度
- 在固定字节预算内,对各张量进行差异化精度再分配
整个过程不涉及任何后训练、LoRA 微调、剪枝或权重更新,所有改进完全来自精度层面的重新分配。
关键结果
在同一约 3.3 GiB 的 IQ2_XXS 预算下,量化前后能力对比显著:
- 推理:从 28.906 提升至 69.531(+40.625 个百分点,95% CI [+24.6, +55.4])
- 上下文:从 15.625 提升至 95.833
- 11 个评估类别中有 10 个相对 imatrix 基线有所改善,唯一退化的维度是稳定性
与 BF16 原模型相比,关键能力的保留率如下:
- 知识问答:97.50%
- 推理:96.74%
- 连贯性:95.92%
- 上下文:95.83%
- 通用忠实度:89.17%
- 指令遵循:81.25%
- 稳定性:73.79%
- 摘要:70.59%
- 数学:60.61%
- 代码:58.49%
- 结构化输出:55.81%
效率与权衡
量化后模型体积约为 BF16 原模型的 24%,推理吞吐约为后者的 2.30 倍。作者同时强调,结果并非全面 BF16 等价,代码、数学、结构化输出等任务仍存在明显能力损失。
模型权重已发布在 Hugging Face(ByteOtter/gemma-4-E4B-it-CADA-IQ2_XXS),文内图表由 ChatGPT 基于作者原始数据生成。整体来看,该实验为「在极受限硬件预算下尽可能保留模型关键能力」提供了一个量化层面的参考案例,但结论尚未经过第三方独立复现。
