开源
23 款 Gemma 4 E4B 衍生模型对比:下载量最高者反而最差
LocalLLaMA 社区对 23 款 Gemma 4 E4B 衍生模型做基准测试,发现热门 OBLITERATUS 模…
2026.07.26 · 周日约 6 分钟阅读
LocalLLaMA 社区研究者「abliterlitics」团队在 HuggingFace 上收集了 23 款 Gemma 4 E4B 衍生模型,并基于 HarmBench ASR(攻击成功率)、GSM8K、MMLU-Pro、KL 散度与改动张量数等指标,对它们进行一次系统性横评。结果显示:下载量最高的 OBLITERATUS 变体(约 80 万次下载)综合表现反而最差,而改动更克制的 heretic 系列在越狱能力与能力保留之间取得了最佳平衡。
核心结论:谁强谁弱
- heretic 系列综合最佳:在 HarmBench ASR 上达到约 95%,由于改动张量更少(28–29 个)、KL 散度极低(0.001–0.002),对模型原有能力的影响最小。
- abliterix 极致越狱:ASR 达到 100%,但代价是 KL 散度上升至 0.054,能力有所折损。
- trevorjs 与 infinimind:ASR 分别为 99.3% 与 98.5%,改动张量 84 个,但 infinimind 与 trevorjs 二进制完全一致,存在隐式衍生关系。
- OBLITERATUS 应被规避:尽管下载量近 80 万,该模型在 HarmBench 中是首个因「过度损坏」而自然产生非拒答的变体——但 GLM 5.2 评审给出了完全不同的结论,ASR 在所有越狱模型中最低、KL 高达 1.1、各能力基准垫底。
- bendernina 与 physshell 被识别为 OBLITERATUS 的 v2 余弦相似度 0.99999,但模型卡互不归属、彼此也不署名原作者。
23 款模型部分排名
| 模型 | ASR | GSM8K strict | KL | 改动张量 |
|---|---|---|---|---|
| abliterix | 100.0% | 87.1% | 0.054 | 89 |
| trevorjs | 99.3% | 88.3% | 0.015 | 84 |
| infinimind | 98.5% | 87.9% | 0.015 | 84 |
| huihui | 98.3% | 87.4% | 0.027 | 70 |
| nullpo | 96.5% | 88.7% | 0.005 | 36 |
| heretic | 95.5% | 88.2% | 0.002 | 29 |
| deckard | 95.5% | 80.2% | 0.022 | 294 |
| mythos | 95.3% | 88.0% | 0.007 | 34 |
| deckard-expresso | 94.8% | 60.4% | 0.052 | 294 |
| coder3101 | 93.8% | 87.9% | 0.002 | 21 |
| heresy | 93.3% | 87.8% | 0.002 | 34 |
| heretic-std | 91.0% | 87.9% | 0.001 | 28 |
| wwt | 88.3% | 89.0% | 0.032 | 34 |
| apostate | (ASR 良好,方法独特) | — | — | — |
排名越靠前的模型并不一定越「值得选」——综合考虑 ASR、GSM8K 与 KL 后,heretic 与 heretic-std 才是能力保留最好的选项。
两个值得关注的异常发现
- SDFT_Heretic_RP 疑似错传:尽管名字里带「heretic」,它在 HarmBench 上 ASR 偏低、改动模式却与 OBLITERATUS 高度相似——两者都精确修改同样的 381 个张量,仅在修改幅度上前者弱约 7.5 倍,研究者怀疑是上传错文件。
- apostate 方法学独特:相较于主流 abliteration 修改注意力张量的做法,apostate 项目修改的是 MLP head 张量,并取得不错的效果,是该研究中首次见到此类路线。
推理蒸馏并未带来收益
作为对照实验,研究者将基于 Claude 4.6 Opus 与 Gemini 3.1 Pro 推理轨迹蒸馏的微调模型一并纳入。结果显示:
- 这些变体并未提升 Gemma 4 的推理能力,反而对其造成了损伤。
- Claude 4.6 Opus 蒸馏版表现最差:GSM8K 下降 17 分,MMLU-Pro 下降 12.5 分,疑似覆盖了 Gemma 4 原生的推理回路。
- Gemini 3.1 Pro 蒸馏版损伤较轻,但仍属净负面。
角色扮演微调的特殊权衡
DavidAU 的 deckard 系列属于「越狱 + 角色扮演」混合微调。其特点是:
- GSM8K strict 与 MMLU-Pro 出现下降,但 HellaSwag、ARC、PIQA 反而上升。
- 研究者推测这是角色扮演训练拉长了推理长度,让模型虽然能答对,却经常越过「#### N」格式标记继续自由发挥。
- HarmBench 中出现的「回答被截断」现象也佐证了这一假设。
整体启示
对于 Gemma 4 E4B 衍生模型的用户,结论相对清晰:
- 选择下载量大的热门模型并不等于选择了好模型。
- 改动张量更少、KL 更低的「外科手术式」越狱(heretic、heresy、coder3101)通常能力保留更好。
- 推理蒸馏与激进角色扮演训练都对该底模有非负即损的影响。
完整 json、日志与全部数据已发布在 HuggingFace 的 Gemma4-e4b-abliterlitics 仓库及 abliterlitics 官网。研究者表示 Gemma 4 12B 的对比将在下一轮进行。
