桃子桃子快讯
返回首页
研究论文

IST-DASLab 提出 SLQ 量化方法:3.3 比特实现任务级无损压缩

IST-DASLab 发表 SLQ 论文,提出任务级与分布级两种无损量化定义及 EAR 指标,在 3.3 比特实现任务无…

2026.07.25 · 周六3 分钟阅读

苏黎世联邦理工学院 IST-DASLab 团队发表论文,提出名为 SLQ(Statistically-Lossless Quantization)的 LLM 量化方法。该方法通过分层非均匀非对称量化与宽位宽搜索,在低于 4 比特(最低 3.3 比特)实现任务级无损压缩,在 5–6 比特实现分布级无损压缩,并配合优化内核获得 1.7–3.6 倍相对 FP16 的推理加速。

核心思路:三种"无损"定义

现有 LLM 量化方法存在明显权衡:GPTQ、AWQ 等技术实用但有损,而完全无损方法保留精度却不加速推理。SLQ 论文聚焦于"统计无损"这一中间地带,给出三种递进定义:

  • 任务级无损(task-lossless):在自然采样方差范围内保持零样本基准准确率。该目标在较为激进的位宽下仍可达成。
  • 分布级无损(distribution-lossless):要求量化模型的 next-token 分布与原始模型在实际意义上不可区分,是更严格的标准。
  • EAR 指标:论文提出最大期望接受率(Expected Acceptance Rate),即在最优耦合下 token 预测一致性的概率上界。EAR ≥ 0.99 即代表 99% 的预测一致。

理论贡献:γ² 方差定律

论文证明了一个关键理论结果——γ² 方差定律:对称量化相较于非对称量化,会将噪声方差放大 γ² 倍。由此得到两点推论:

  • 对于分布级无损保真,非对称量化是必要的;
  • 对于任务级精度保持,对称与非对称之间并无本质差异。

该定律从理论上解释了为何在追求极限精度时必须采用非对称量化路径。

实践效果:低位宽下的无损压缩

基于分层非均匀非对称量化与宽位宽搜索,SLQ 在公开模型上的实测结果如下:

  • 任务级无损:低于 4 比特/参数可达,部分模型最低至 3.3 比特;
  • 分布级无损:平均 5–6 比特/参数可达;
  • 推理速度:配合优化内核,相对 FP16 达到 1.7–3.6 倍加速。

论文中多次提及 llama.cpp 与 GGUF 生态,说明该方法与当前主流 CPU/GPU 推理栈存在兼容基础。

背景与来源

论文由 IST-DASLab 团队撰写,arXiv 编号 2605.02404,GitHub 仓库 IST-DASLab/SLQ 显示代码即将开源。该研究约两个月前发布,近日因 Red Hat AI 在社交媒体转发而再次进入本地部署社区讨论。论文同时引用了 Gerganov 与 llama.cpp 贡献者的工作,体现出与开源量化生态的紧密关联。

信源