桃子桃子快讯
返回首页
开源

Qwen3.8-27B 去对齐变体实测:拒绝率大降,能力几乎未损

社区发布的 Qwen3.8-27B 去对齐 FP8 版本在多套有害指令集上拒绝率由 64–99% 降至 0–6%,MML…

2026.08.16 · 周日2 分钟阅读

Reddit 社区 r/LocalLLaMA 用户 niacolhealth 围绕一份去对齐(abliterated)处理后的 Qwen3.8-27B FP8 模型评测表展开讨论。原模型被作者明确标注为「红队测试素材」并附有免责声明,但其量化数据本身具有研究参考价值——尤其是当拒绝率被显著压低时,通用能力是否受到牵连,是社区长期关注的问题。

拒绝率:高位区间大幅压低

在该变体的内置评测中,针对 AdvBench、HarmBench、StrongREJECT 等常见有害指令集,模型在关闭「思考」模式下的拒绝率落在 0–6% 区间,而对应基座检查点的范围为 64–99%。换句话说,在这些规则化测试场景下,模型几乎不再以「我无法回答」之类的前缀开头回应。

通用能力:基准分数基本不变

为判断去对齐是否「拖累了网络其余部分」,评测在同一脚本下独立测量能力维度:

  • MMLU:84.3 → 84.7
  • GSM8K:90.0 → 88.7

两组指标的变动幅度均在 1.3 分以内,未出现明显的能力塌陷。原文据此认为,这为此前 Arditi 等人提出的「单方向拒绝去除」结论提供了又一份数据支持——即拒绝行为可以在不显著拉动整张网络表征的前提下被剥离。

评测方法本身的两处保留

作者同时指出了该评测不可被过度解读的原因:

  • 拒绝率采用的是 OrcaRouter 自带的基于规则分类器,原模型卡片已说明其结果仅为「指示性」,未达可发表标准;分类器主要判断回复首句是否包含拒绝表述,对第一句之后的内容几乎不评估。
  • 能力侧与拒绝侧分属两套评测族系,彼此并不能为对方背书;若要验证能力指标在他人评测框架下依然成立,仍需独立复现。

缺失的关键对照

原文特别提到,整个评测材料中并未提供与基座模型之间的 KL 散度(KLD)数据。在去对齐类研究中,KLD 通常用于衡量模型输出分布的偏移程度——它的缺席意味着读者无法直接判断该变体在多大程度上「仍像原模型」。

小结

这份社区材料的意义更多在于补充一次量化观察:拒绝行为被显著削弱的同时,常用基准能力并未出现可量化的损失。但正如作者本人强调,规则式分类器与缺少 KLD 对照限制了结论的强度,相关结果若要进入更严肃的讨论,仍需第三方独立复现。

信源