Gemma 4 12B 减审查变体横评:11 种方法谁更稳
社区项目 Abliterlitics 在单张 RTX 5090 上耗费 165 GPU 小时,对 11 种 Gemma…
社区项目 Abliterlitics 发布了一份针对 Gemma 4 12B 的横向评测报告,对比了 11 个从 HuggingFace 上下载量靠前的去审查(abliterated)变体以及 2 个被点名的 LoRA 适配器,并以官方基座模型作为参照。测试在单张 RTX 5090 上累计运行 165 GPU 小时,历时约三周半,涵盖权重取证、KL 散度、13 项能力基准以及 HarmBench 的 400 个危险行为。最终共得到 6,800 条回答、6,000 次 LLM 裁判判定。
评测方法
研究者将所有变体与官方基座在相同条件下进行对比,使用 GLM 5.2 作为裁判模型,读取完整推理轨迹再做判断。HarmBench 关注 ASR(攻击成功率),能力侧覆盖 GSM8K、GPQA、MMLU-Pro、TQA 等常用基准,并记录 KL 散度(衡量输出分布偏离基座的程度)与被修改的张量数量。每个模型回答还会被分类为空输出率,用以识别「思考循环卡死」等异常。完整报告、每条回答与判定结果均已公开在 abliterlitics.dev 和 HuggingFace 上。
排序与核心发现
按裁判 ASR 由高到低,主要结论如下:
- huihui 89.8%,去审查最强但代价最高:TQA -14.3pp、GPQA -8.1pp,约 24% 的 GSM8K 尝试因思考超预算而空输出。
- trevorjs 85.8%,综合权衡最佳,各项能力几乎贴近基座。
- coder3101 81.0%,GSM8K 反超基座,是整组中最优。
- sdft LoRA 79.5%,与前几名去审查方法持平,能力完全保留,作者在报告中分享了 LoRA 训练思路。
- jwest33 78.0%,使用新的零空间工具,能力保持但推理稳定性下降。
- llmfan Heretic ARA 76.3%,仅动 16 个张量,GSM8K 比基座高 1.9pp。
- prithiv 72.5%,非 LoRA 中 KL 散度最低,独立干净运行。
- abliterix 68.8%,能力近乎完整,居中。
- openyourmind 67.0%,MMLU-Pro -22.4pp,空输出率 38%,作者承认此方法面向更大模型,本次仅作测试。
- obliteratus 60.8%,命中能力回路,能力损失最大,建议避开。
- apostate 45.8%,最保守,化学/生物类拒答保留 82%,但基于旧版 Apostate。
- 官方基座 21.0%,其中过半由 100 道版权题贡献,直接危害类近乎为零。
思考模型带来的测量偏差
Gemma 4 12B 是带思考过程的推理模型,正则关键词分类器会把「推理中无意泄露的合规内容」漏算,导致 huihui 在关键词匹配中排第 3、由裁判排名却升至第 1,差距高达 13 个百分点。如果只看「正常答完」的部分,huihui 的有效 ASR 为 88.0%,与基座仅差 0.7pp——能力并未消失,消失的是推理稳定性。空输出率从 coder3101 的 6.9%(优于基座)到 openyourmind 的 38%,跨度极大。
权重编辑的精细度
报告中反复出现「外科手术式编辑」的概念:huihui 仅动 12 个张量、占模型 1.8%,解锁最强;obliteratus 改 144 个、openyourmind 改 620 个,反而去审查更少。研究者由此提出「位置比幅度更决定解锁力度,但不决定副作用」——若要在解锁和稳定性之间取平衡,trevorjs 与 prithiv 是更安全的选择。
资源与下一步
- 完整报告:abliterlitics.dev/models/gemma4-12b
- 每条回答与裁判判定可逐条浏览:abliterlitics.dev/harmbench/gemma4-12b
- HuggingFace 模型:DreamFast/Gemma4-12b-it-abliterlitics
- 代码:github.com/dreamfast/abliterlitics
作者已收到社区请求,下一轮将评测 Qwen 3.8 27b,并开放 Discord 渠道供读者点单模型或讨论基准选择。
