桃子桃子快讯
返回首页
研究论文

Gemma 4 12B 减审查变体横评:11 种方法谁更稳

社区项目 Abliterlitics 在单张 RTX 5090 上耗费 165 GPU 小时,对 11 种 Gemma…

2026.08.25 · 周二4 分钟阅读

社区项目 Abliterlitics 发布了一份针对 Gemma 4 12B 的横向评测报告,对比了 11 个从 HuggingFace 上下载量靠前的去审查(abliterated)变体以及 2 个被点名的 LoRA 适配器,并以官方基座模型作为参照。测试在单张 RTX 5090 上累计运行 165 GPU 小时,历时约三周半,涵盖权重取证、KL 散度、13 项能力基准以及 HarmBench 的 400 个危险行为。最终共得到 6,800 条回答、6,000 次 LLM 裁判判定。

评测方法

研究者将所有变体与官方基座在相同条件下进行对比,使用 GLM 5.2 作为裁判模型,读取完整推理轨迹再做判断。HarmBench 关注 ASR(攻击成功率),能力侧覆盖 GSM8K、GPQA、MMLU-Pro、TQA 等常用基准,并记录 KL 散度(衡量输出分布偏离基座的程度)与被修改的张量数量。每个模型回答还会被分类为空输出率,用以识别「思考循环卡死」等异常。完整报告、每条回答与判定结果均已公开在 abliterlitics.dev 和 HuggingFace 上。

排序与核心发现

按裁判 ASR 由高到低,主要结论如下:

  • huihui 89.8%,去审查最强但代价最高:TQA -14.3pp、GPQA -8.1pp,约 24% 的 GSM8K 尝试因思考超预算而空输出。
  • trevorjs 85.8%,综合权衡最佳,各项能力几乎贴近基座。
  • coder3101 81.0%,GSM8K 反超基座,是整组中最优。
  • sdft LoRA 79.5%,与前几名去审查方法持平,能力完全保留,作者在报告中分享了 LoRA 训练思路。
  • jwest33 78.0%,使用新的零空间工具,能力保持但推理稳定性下降。
  • llmfan Heretic ARA 76.3%,仅动 16 个张量,GSM8K 比基座高 1.9pp。
  • prithiv 72.5%,非 LoRA 中 KL 散度最低,独立干净运行。
  • abliterix 68.8%,能力近乎完整,居中。
  • openyourmind 67.0%,MMLU-Pro -22.4pp,空输出率 38%,作者承认此方法面向更大模型,本次仅作测试。
  • obliteratus 60.8%,命中能力回路,能力损失最大,建议避开
  • apostate 45.8%,最保守,化学/生物类拒答保留 82%,但基于旧版 Apostate。
  • 官方基座 21.0%,其中过半由 100 道版权题贡献,直接危害类近乎为零。

思考模型带来的测量偏差

Gemma 4 12B 是带思考过程的推理模型,正则关键词分类器会把「推理中无意泄露的合规内容」漏算,导致 huihui 在关键词匹配中排第 3、由裁判排名却升至第 1,差距高达 13 个百分点。如果只看「正常答完」的部分,huihui 的有效 ASR 为 88.0%,与基座仅差 0.7pp——能力并未消失,消失的是推理稳定性。空输出率从 coder3101 的 6.9%(优于基座)到 openyourmind 的 38%,跨度极大。

权重编辑的精细度

报告中反复出现「外科手术式编辑」的概念:huihui 仅动 12 个张量、占模型 1.8%,解锁最强;obliteratus 改 144 个、openyourmind 改 620 个,反而去审查更少。研究者由此提出「位置比幅度更决定解锁力度,但不决定副作用」——若要在解锁和稳定性之间取平衡,trevorjs 与 prithiv 是更安全的选择。

资源与下一步

  • 完整报告:abliterlitics.dev/models/gemma4-12b
  • 每条回答与裁判判定可逐条浏览:abliterlitics.dev/harmbench/gemma4-12b
  • HuggingFace 模型:DreamFast/Gemma4-12b-it-abliterlitics
  • 代码:github.com/dreamfast/abliterlitics

作者已收到社区请求,下一轮将评测 Qwen 3.8 27b,并开放 Discord 渠道供读者点单模型或讨论基准选择。

信源