桃子桃子快讯
返回首页
研究论文

ALIBI:对LLM漏洞检测器的自适应智能体攻击

研究提出ALIBI框架,通过在代码中插入对抗性注释,成功欺骗多种LLM漏洞检测器,攻击成功率超90%。

2026.07.29 · 周三3 分钟阅读

一项发表于 arXiv 的研究提出了名为 ALIBI 的自动化自适应黑盒攻击框架,揭示了基于大语言模型的漏洞检测器存在一个此前被低估的攻击面:源代码中的对抗性注释。该研究由 Zixuan Wu 等人完成(arXiv:2607.24964,cs.CR),核心结论是当前主流 LLM 漏洞检测器极易被此类攻击欺骗,攻击成功率在 125 个真实空指针解引用漏洞上超过 90%,在某个系统上甚至达到 100%。

研究背景与攻击模型

随着大语言模型被广泛部署于安全敏感任务(如漏洞检测与代码审查),其对源代码中自然语言上下文的依赖暴露了新的风险。研究者刻画了一类新型攻击者——一个编码智能体(coding agent),它既能为代码添加新功能,也会主动引入漏洞,并通过精心构造的源代码注释规避检测。

关键点:

  • 攻击面:源代码中的自然语言注释,而非可执行逻辑。
  • 攻击方式:不改变程序行为,仅通过注释影响检测器的推理过程。
  • 攻击场景:黑盒、自适应——攻击者可根据检测器反馈迭代优化注释内容。

ALIBI 框架与实验结果

ALIBI 利用检测器的推理输出与反馈,自动生成并迭代优化对抗性注释。研究团队将真实世界中修复漏洞的代码提交(commits)转化为编码任务,对四类代表性 LLM 漏洞检测器进行了评估,涵盖从专用开源权重推理模型到前沿多智能体系统。

主要实验发现:

  • 整体效果:在 125 个真实空指针解引用漏洞上,所有被测检测器的攻击成功率均超过 90%。
  • 极端情况:在某个系统上达到 100% 攻击成功率。
  • 跨类别泛化:框架的有效性不限于空指针解引用一类漏洞。
  • 最有效策略:引导检测器推理方向的注释,以及伪造外部工具调用结果的注释。
  • 迭代优化:基于检测器反馈的迭代优化可进一步提升攻击成功率。

防御手段评估

研究还考察了多种缓解措施的实际效果,结果显示:

  • 提示级防御(prompt-level defenses):对自适应攻击的鲁棒性有限。
  • 架构隔离(architectural isolation):可显著提升系统韧性。
  • 检测前注释清洗(pre-detector comment sanitization):是另一项能实质性提升防御能力的关键措施。

意义与启示

该研究指出,当前基于 LLM 的漏洞检测器在「自然语言上下文」与「程序语义证据」之间的信任校准存在根本性缺陷。对于正在将 LLM 引入代码审查、安全审计与 CI/CD 流水线的团队而言,这一发现提示:在依赖 AI 进行安全决策时,必须将注释等非可执行内容纳入威胁建模,并通过架构隔离与前置清洗降低被对抗性输入操纵的风险。

信源