不完整提示越狱:大语言模型安全的新盲区
arXiv论文提出「不完整提示越狱」概念,发现大模型倾向将拒答推迟至句末,参数微调防御难以泛化,并识别出两类功能神经元。
研究背景:开放权重模型的安全防线仍有缝隙
随着 GPT、Llama、Qwen 等大语言模型以开放权重(open-weight)形式广泛发布,开发者与研究者能够更自由地部署和微调这些模型。但开放权重也意味着配套的越狱攻击面随之扩大。传统越狱多依赖完整的恶意指令诱导模型输出有害内容,而一项最新 arXiv 研究则把目光投向了一个此前较少被系统讨论的角落:尚未写完的「不完整」有害提示。
核心发现:不完整提示越狱(IPJ)
该论文将这种现象正式命名为「Incomplete Prompt Jailbreaks(IPJ)」,并给出系统化的实证刻画。研究发现,大语言模型在面对不完整的有害句段时,往往倾向于顺着句子继续补全,而不是立即触发拒答机制——即模型系统性地把拒绝行为「推迟」到句末之后才发生。这种行为模式绕过了面向完整指令设计的传统安全对齐策略,构成了一类新的攻击向量。
研究还分析了与「续写吸引子」相关的多种类型,表明 IPJ 现象在不同内容领域均能稳定出现,具有较强的迁移性。
防御为何失效:参数微调难以泛化
一种直觉上的防御方式是:在训练阶段让模型学会拒绝不完整的有害提示。然而论文指出,通过参数微调实现这一目标并不充分,原因在于:
- 微调后的拒答能力难以同时覆盖不同的内容领域;
- 也难以覆盖不同类型的续写吸引子;
- 防御效果在跨域、跨攻击模板测试中均出现明显退化。
这意味着仅靠全参数或轻量微调,无法构建对 IPJ 稳健的防御层。
机制解释:终止神经元与续写神经元
为寻找更精细的干预手段,研究者深入到模型内部,识别出两类与句子补全过程密切相关的功能神经元:
- 终止神经元(termination neurons):与触发拒答、结束生成行为相关;
- 续写神经元(continuation neurons):与驱动模型继续补全句子相关。
通过在推理阶段对这两类神经元施加定向干预,研究者展示了「神经元级防御」的可行性,认为这是比单纯训练阶段对齐更精准、更可控的潜在防御路径。
研究意义与待跟进方向
该工作的价值在于:
- 概念化了一个此前零散、但客观存在的攻击现象,为后续安全评测提供了统一术语;
- 实证了当前主流对齐手段在 IPJ 上的盲区;
- 机制层面给出神经元级干预这一可落地的防御方向。
局限方面,论文摘要未公开具体测试模型清单、benchmark 数字与跨模型对比结果,这些信息需查阅正文与附录才能进一步评估其结论的普适性。对于正在构建越狱评测集、模型红队体系以及安全对齐流程的团队,这一研究方向值得持续跟踪。
