桃子桃子快讯
返回首页
工具

Gemma 4 12B Q3 量化新方案:编码性能提升 8.55%

开发者将类别特定 imatrix 与张量级位宽分配结合,在 Gemma 4 12B Q3_K_S 上使编码评分从 45.…

2026.08.14 · 周五2 分钟阅读

一位本地大模型社区的开发者在 Hugging Face 上发布了一款名为 Gemma-4-12B-it-CADA-Q3_K_S 的专用量化模型。该方案的核心思路是在已有重要性矩阵(imatrix)的基础上,按张量粒度重新分配固定的位宽预算,把更多比特留给那些在量化中损失最大、补充精度后恢复收益最高的张量。作者将这一管线称为「任务感知张量级位宽分配」,并自述这是该分配阶段首次在实际模型上取得可验证的明显增益。

方法概览

  • 基于 TASA、TAQO 等任务感知量化思路,把分配粒度从层(layer)下沉到张量(tensor)级别。
  • 用类别特定的语料库生成自定义 imatrix,定位量化造成的损伤点。
  • 在固定比特预算下,将额外精度优先分配给在该类别中恢复收益最大的张量。

在 Gemma 4 12B 上的结果

测试对象为 Gemma 4 12B 的 Q3_K_S 量化版本,未公布所用编码基准名称,作者仅给出分数对比:

  • 手工调参 imatrix 的 Q3_K_S:45.974
  • 加入张量级分配后的 Q3_K_S:49.905
  • 相对提升:+3.931 分,约 +8.55%
  • 模型文件大小:5,528,230,848 字节 → 5,534,804,928 字节,增加约 0.119%

作者特别指出,量化档位选择 Q3 是因为该档位仍位于「量化悬崖」之上,且拥有最大的可恢复余量(recoverable headroom),因此分配策略的边际收益最明显。

局限与后续计划

模型被刻意做成「类别专用」,在未参与调优的任务类别上预期会出现退化,这与作者的目标一致。后续仍有较多调优空间,例如把方案扩展为通用管线,接受任意全精度 .gguf 输入并自动输出某类别下最优体积的量化模型。

该模型文件已在 Hugging Face 上由 ByteOtter 公开,社区测试与反馈仍在进行中。需要提醒的是,目前的所有数据均来自作者自报,并未经过独立复现或第三方基准验证。

信源