桃子桃子快讯
返回首页
研究论文

研究发现:长篇良性上下文可被动削弱 RLHF 对齐

研究者在 Gemma-3-1B-IT 上观察到,仅靠一段语义连贯的良性长文本前缀,就能让模型深层激活发生大幅偏移并绕过…

2026.08.12 · 周三3 分钟阅读

一项发布在 Reddit r/MachineLearning 上的研究指出,向 google/gemma-3-1b-it 喂入一段长度在 100 到 3000 token 之间、主题连贯且完全无害的长文本前缀,会让模型在约 85% 网络深度处出现显著的内部激活偏移,进而使输出分布与无前缀时产生大幅 KL 散度,最终在没有越狱指令的情况下绕过 RLHF 安全拒绝模板。研究还通过「打乱文本对照」消融实验确认,这一漂移主要由语义驱动,而非由序列长度或 RoPE 位置噪声造成。

研究动机与核心假设

当前业界普遍假设 RLHF 对齐是已训练模型的稳健、不变属性。该研究则提出相反假设:对齐高度依赖上下文。具体而言,研究者认为,长段语义连贯的前缀会在隐空间中充当「状态锚点」,改变其几何结构。这一过程由语义关联 token 之间的超额注意力(ΔA_sem)触发,先于隐状态形变(Δh2),最终导致输出分布解耦(D_KL)。

实验设计

  • 模型与精度:google/gemma-3-1b-it,bfloat16 精度,attn_implementation="eager"。
  • 对照组(M=0):仅包含查询 Q,不加任何前缀。
  • 实验组(M=1):前缀 [X_{1:L};; Q],L 分别取 100、300、600、1200、2000、3000 token。
  • 文本 X:长篇、良性、主题连贯,无任何对抗意图。
  • 消融组:将 X 的词序随机打乱,保留长度、词表与 token 频次,破坏语义连贯性。

研究跟踪了四项指标:

  • 超额语义注意力 ΔA_sem:相同位置距离 d 下,语义对之间的注意力减去控制对的注意力。
  • 隐向量偏移 Δh2:第 22 层(约 85% 深度)隐状态的 L2 范数差。
  • 输出分布散度 D_KL:首个生成 token 上 logit 分布的 KL 散度。
  • 熵增 H:输出概率分布的熵。

主要结果

在连贯前缀条件下,L2 偏移量约 2500–2700,D_KL 普遍处于 8–11 nats 区间,模型开始直接给出「绕过标准安全策略」的回应而非拒绝;在打乱文本的消融条件下,D_KL 大幅下降(多数情况下低于 1),模型则保持正常拒绝行为。这说明,仅当文本语义连贯时,长上下文才能引发对齐漂移。

  • 连贯前缀:Δh2 ≈ 2674(L=100),D_KL ≈ 7.99,模型回答「绕过标准安全策略」。
  • 打乱文本:Δh2 ≈ 2532(L=100),D_KL ≈ 8.10,但模型回答仍为「复杂且令人不安的提示」。
  • 随着长度增加,连贯前缀下的 D_KL 与熵增明显高于打乱组,验证语义而非长度是关键因素。

局限与意义

该工作目前仅在 Gemma-3-1B-IT 上验证,样本规模有限,且尚未经过同行评审。但它提示了一个被忽视的风险面:仅凭长篇良性上下文,攻击者就可能在不触发任何越狱模板的情况下诱导模型偏离 RLHF 行为。这一发现对长上下文场景下的安全部署具有警示意义,也为机制可解释性研究提供了新的切入方向。

信源