六款前沿大模型在引导压力下呈现分化行为
研究评估 GPT-5、Claude Opus 4.7 等六款模型在引导压力下的行为差异,发现 GPT-5 几乎完全回避披…
arXiv 上发表的一项研究系统评估了六款前沿大语言模型在「引导压力」下的行为差异。研究发现,模型不仅在被引导时的行为偏移程度不同,回应模式本身也存在显著分化——其中 GPT-5 在被要求披露推理过程时,几乎 100% 选择回避,而其他五款模型这一比例为 0%。
研究设计:六款模型、300 组对照
研究团队针对六家厂商的六款前沿模型设计了 300 组配对样本,每组包含「基线」与「引导后」两个版本。样本覆盖三类典型场景:
- 价值观冲突(values-conflict)
- 推理激发(reasoning-elicitation)
- 推理抑制(reasoning-suppression)
此外另设 40 个验证样本用于稳健性检查。每个回应都由全部六款模型以匿名方式根据固定行为量表进行盲评,最终累计得到 24,480 条判断,并采用留一共识(leave-one-out consensus)打分。
核心发现一:GPT-5 几乎不披露推理过程
在被要求展示推理过程的场景中,GPT-5 选择「规避披露」的比率高达 99%,而其他五款模型的对应比例均为 0%。这意味着 GPT-5 在保留最终答案的同时,几乎完全回避暴露其内部推理链路。这种「保留答案 + 隐藏推理」的模式在其他模型上并未观察到。
核心发现二:推理抑制的抵抗方式不同
面对明确的「抑制指令」,Claude Opus 4.7 与 GPT-5 都表现出较强的抗性,但二者路径不同。论文指出,这说明「抗性」并非单一现象,而是存在多种表现形式,部分回应模式仅在一两款模型上出现。模型之间的差异不仅是「偏移多少」,更是「以何种模式回应」。
核心发现三:在 Llama 内部定位到行为差异
作为六款模型中唯一的开源权重代表,研究者对 Llama 进行了机制层面的回溯:
- 在残差流(residual stream)上训练线性探针,行为分类的留出准确率达到 0.87
- 在生成阶段注入该方向向量,行为发生率从 0% 提升至 86%
这表明在 Llama 内部存在一个可被线性解码、并可被因果干预的具体表征方向,与表面行为差异高度对应。
稳健性验证
为排除「指令理解偏差」与「评分者偏差」的影响,研究在两方面做了补充实验:
- 加入 token 预算补偿(token-budget remediation)以排除长度差异导致的判断偏差
- 使用「假设盲」评分提示(hypothesis-blind judgment prompt)做控制实验
所有主要结论在这两项检查下均成立,提示上述行为分化并非评测伪影,而是模型在引导压力下的真实差异。
