研究论文
去除审查会让大模型更「乐观」?Reddit 用户实测 Gemma 与 Qwen
用户在 Gemma 与 Qwen 的去审查版本上完成 21,600 次股票预测对照实验,发现模型整体更自信、措辞更乐观,…
2026.07.29 · 周三约 3 分钟阅读
一名开发者在 r/LocalLLaMA 社区发布了一组针对「去审查」大模型的对照实验:在 Gemma 与 Qwen 两款开源模型上,对比原始版本与 abliterated(去除对齐拒绝)版本在股票预测任务上的表现。共完成 21,600 次决策,并进行了预注册,承诺数据与代码公开(论文链接:arxiv.org/abs/2607.17427)。
核心发现:更自信,而不是更准确
实验者最初假设,去除审查后模型会更「敢说话」,可能给出更直接的预测。但实际结果超出了预期:
- 整体语气更乐观:去审查版本中「上涨」类判断显著增多,「也许」「不确定」类措辞减少。
- 推理更冗长、表达更笃定:模型倾向给出更长、更自信的推理链。
- 准确率没有提升:与原版模型基本一致,约为随机水平(抛硬币准确率)。
换言之,去审查让模型「更敢下结论」,但并没有让它「更对」。
模型差异:同一操作,不同方向
一个意外结果来自两款模型的对比:
- Gemma:去审查后置信度反而下降。
- Qwen:去审查后置信度上升,与整体趋势一致。
同一编辑方法在两个模型族上出现了方向相反的变化,说明 abliteration 的副作用并不统一,可能与各模型在 RLHF 阶段注入的偏好分布有关。
实验设置
- 硬件:本地 GB10 / Dell 机器运行。
- 模型:Huihui 提供的 abliterated 版本,与同源原版对照。
- 任务:模型收到包含行情、新闻等结构化数据的提示,需判断某上市公司未来一周走势。
- 样本量:两款模型各版本合计 21,600 次决策,输入数据完全一致。
- 方法学:作者声称已预注册实验方案,并公开数据与代码。
局限与待验证之处
- 仅覆盖 Gemma 与 Qwen 两族模型,结论是否可推广到 Llama、Mistral 或其他去审查方法(如 Heretic)仍待验证。
- arXiv 编号 2607.17427 对应 2026 年 7 月,目前尚无法核实是否已正式上线。
- 任务为股票短期走势,本身具有强随机性,对模型「能力」的区分力有限。
- 「乐观度」的量化依赖措辞统计,缺少统一的情绪评分基准。
作者在结尾邀请社区复现,并询问是否有人在 Llama、Mistral 等模型上观察到类似的「性格漂移」。该实验再次提示:去审查并不是「只关掉一道开关」,它会同时改写模型输出的姿态与确定性。
