开源
Qwen3-27B 量化实验:哪些权重组真正决定质量
社区作者逐组量化测试 Qwen3-27B 的 14 类权重,公布 Bedrock/Tightrope/Gambit 三档…
2026.08.16 · 周日约 4 分钟阅读
Reddit 用户 enginetown 在 r/LocalLLaMA 发布了一份针对 Qwen3-27B 的系统性量化分析。作者延续此前 Qwen3.6 项目的方法:逐个权重组量化、计算相对 Q8_0 基线的 KL 散度(KLD),再据此组装出三档量化产物——Bedrock、Tightrope、Gambit,并在 Hugging Face 上以开源形式发布。
实验方法:逐组隔离测试 + 整体组合验证
Qwen3-27B 采用 DeltaNet 与全注意力混合架构,共 14 类可独立测试的权重:
- 大部分 DeltaNet 块:attn_qkv、attn_gate、ssm_alpha、ssm_beta、ssm_out,以及 ffn_gate、ffn_up、ffn_down
- 每四个块出现一次的全注意力块:拆分为 attn_q、attn_k、attn_v、attn_output
- 全局共享权重:token_embd 与 output_weight
作者先用 imatrix 校准单组量化的「安全下限」,再把多组保护叠加到合并模型中做端到端验证;当合并结果差于隔离测试预期时,再做定向探测,逐项找出拖低质量的组件。
关键发现:隔离测试与组合效果不一致
实验中有几项反直觉的结论:
- attn_v 隔离 KLD 全场最差,但在合并模型中保护它与不保护结果完全相同。attn_gate 同样如此。
- ssm_alpha 在隔离测试中最先劣化,可一旦在合并模型中加以保护,整体表现反而更差。
- 合并模型中最强的两个「杠杆」是 attn_qkv 与 ffn_down,二者隔离测试表现平平。仅恢复 attn_qkv 就一次性缩小 55% 的工具调用差距与 13% 的通用差距;再叠加 ffn_down 恢复,可继续缩小 24% 的工具调用差距与 15% 的通用差距。
- token_embd 与 output_weight 必须成对保护:单独保护会拖累工具调用,但与 attn_gate 一起保护时,可对冲这一回退。
四项任务中,工具调用始终是最先劣化、波动最大的指标,错误分布呈尖峰状——少量 token 承担了大部分散度,而非均匀漂移。
三档产物与实测 KLD
三套合并模型相对 Q8_0 基线的 KLD 数据如下:
- Bedrock(13.91 GiB,4.37 BPW):通用 0.0177 / 代码 0.0034 / 数学 0.0048 / 工具调用 0.0200
- Tightrope(13.14 GiB,4.13 BPW):通用 0.0252 / 代码 0.0040 / 数学 0.0067 / 工具调用 0.0404
- Gambit(12.54 GiB,3.94 BPW):通用 0.0455 / 代码 0.0064 / 数学 0.0112 / 工具调用 0.0542
作者表示,所有档位均未越线(红色阈值),代码任务在三档下都保持绿色,通用与工具调用则始终未到绿色——这是当前模型尺寸下高强度量化的真实代价。
适用范围与局限
上述数字全部为相对 Q8_0 的 KLD 指标,并非定性体验。作者暂未做大量人工测试,并欢迎用户在 Hugging Face 仓库(enginetown/Qwen3.8-27B-Calibrated)试用后反馈具体问题。帖子末尾附有一段由 Gambit 量化版一次性生成的「玻璃水缸破裂」物理模拟输出,作为直观参考。
