桃子桃子快讯
返回首页
研究论文

GLM-5.2 无损压缩实验:内存可减约 25–30%

对 GLM-5.2 753B 全部权重扫描后,两条独立路径分别实现 24.967% 与 30.168% 的内存缩减,但运…

2026.07.20 · 周一3 分钟阅读

研究人员对智谱 GLM-5.2(753B 参数,BF16 精度)进行无损压缩扫描后发现,其全部权重可在不损失精度的前提下减少约 25%–30% 的内存占用,但运行时性能尚未跑赢 BF16。

核心发现:两条独立测算路径

实验采用两种相互独立的方法对 GLM-5.2 的全部权重进行分析。

  • K15 计费式测算:将 BF16 权重中 9 位的符号与指数组合替换为指向 15 项码表的 4 位编码,稀有 9 位符号转存至精确转义流;7 位尾数保持原始。完整计费后平均每个权重 11.173 bit,相当于减少 30.168%,容量从 1,403.19 GiB 降至 979.87 GiB。
  • 字节切分精确还原:流式验证器根据码表、索引与转义流重建高字节,低字节逐字保留,再与源权重逐张量对比。结果显示全部 59,509 个 BF16 张量比特级一致,平均 12.005 bit/权重,减少 24.967%。

两条结论属于不同证据类别:K15 是带计费的容量估算,未经 GLM 规模的独立解码;字节切分则是已被完整解码验证的精确路径。

技术原理

BF16 权重由 1 位符号、8 位指数和 7 位尾数组成。训练完成的模型中指数取值高度集中——少数符号即可覆盖绝大多数权重。实验利用这一特性压缩符号与指数段,尾数段保持原始以确保比特级一致。该方法与基于 KL 散度或量化误差的传统压缩有本质区别,目标是零误差还原。

运行时表现与待解问题

研究人员在 A40 GPU 上测试了一个独立的 12 bit 稠密原型:解码在寄存器内完成,无需在矩阵乘法前完整恢复 BF16 权重。但其 GEMV 时间为 BF16 的 0.733 倍,反而比原始格式更慢。稀疏转义修正虽已单独验证,但未融合进该计时测试。因此以下三项仍是开放问题:

  • 真正的无损速度提升
  • GLM 规模的 K15 物理容器
  • 端到端推理服务的集成方案

相关工作与差异化

ZipNN、DFloat11 已在大模型尺度上建立 BF16 指数无损压缩方案,其中 DFloat11 采用可变长 Huffman 码,在矩阵乘法前还原 BF16 权重。ZipServ 是最接近的运行时设计:固定长编码直接寄存器内重建。本实验采用不同表示——基于 15 项联合符号与指数的每张量 4 位编码,配合稀疏精确转义——并未将共享指数冗余(约 11 bit 范围)或融合概念声称为新发现。

可复现性

作者发布了一键脚本,无需 GPU,可独立验证:

  • 从 Hugging Face 流式读取约 1.4 TB BF16 权重
  • 逐分片验证字节切分重建的比特一致性
  • 分别计算 K15 路径的完整计费尺寸

复现命令:uv run verify.py zai-org/GLM-5.2。验证已于 2026-07-12 在盲测(blind gate)环境下通过。

信源