桃子桃子快讯
返回首页
研究论文

arXiv 论文提出多智能体授权框架 APC,可阻断几乎全部数据窃取攻击

研究团队提出 Agentic Principal Chain(APC)授权架构,通过六项检查追踪多智能体系统的委派权限,…

2026.08.21 · 周五3 分钟阅读

随着 LLM 智能体(agent)开始代替用户访问云服务、调用工具甚至委派子智能体,其权限边界与组合风险成为新的安全痛点。一篇发表于 arXiv 的论文《Bounded Agents: Delegation Security for Multi-Agent AI Systems》提出了一种名为 Agentic Principal Chain(APC)的授权架构,将这类问题定义为「授权架构问题」而非单纯的模型问题,并通过六项检查、形式化定理与大规模基准测试,验证了该方案在多智能体场景下的有效性。

核心思路:把安全关进「授权链」里

APC 的基本观察是:当前智能体的权限在会话开始时被静态设定,每条请求独立评估,互不关联;一旦智能体拥有执行某类操作的权限,提示词注入(prompt injection)就具备了真正威胁,模型本身是否被攻陷反而不是最关键的环节。为此,作者提出 APC 需要满足三点要求:

  • 在委派过程中传递并限制作用域与预算;
  • 利用组合闭包(composition closure)对照历史动作检查新请求,避免若干「单独允许」的操作组合出被禁止的结果;
  • 将最终授权判定放在模型外部强制执行,不依赖模型行为。

APC 沿委派链追踪从原始主体到每一级子智能体的权限,对每条请求执行六项授权检查,并维护整个会话的累积状态。

理论保证:两条形式化定理

论文给出了两条可证明的性质:

  • Blast Radius Monotonicity(爆炸半径单调性):智能体权限随委派链只可能缩小、不会扩大。
  • Composition Soundness(组合健全性):在「完整限制集」与「串行准入」两个前提下,APC 能够可靠地阻断任意被禁止的组合动作。

其中组合健全性存在明确的适用范围限制,作者也在文中如实披露。

实验结果:数据窃取几乎归零

作者在 InjecAgent、AgentDojo 与 ASB 三个基准上共评估了 3,154 个实例,并设计了一种「被攻陷模型」评估方法——在第一次合法工具调用之后直接插入真实攻击调用,从而将模型行为与授权机制解耦。关键数据如下:

  • AgentDojo 数据外泄(exfiltration)成功率由 75–100% 降至 0%,覆盖全部四个领域;
  • InjecAgent 数据窃取全部 544 例被 APC 阻断;
  • Intent binding(意图绑定)将「破坏」类攻击成功率从 38.6% 降至 4.0%,「操纵」类从 90.5% 降至 12.1%;
  • 授权判定在空闲主机上的 99 分位延迟仅为 0.24 ms;
  • 在 949 对 AgentDojo 任务注入测试中,实用性(utility)在两种设置下分别下降 8.6 与 13.9 个百分点。

适用边界与开源

APC 并非万能:组合健全性依赖完整的限制集与串行准入假设,实用性也存在可量化的折损。论文同时提供了实现代码、评估工具与公开数据,便于后续研究者复现与扩展。整体而言,这项工作把多智能体安全从「靠模型对齐」的软约束转向了「靠授权架构」的硬约束,为当前快速扩张的 agent 生态提供了一条可工程化的防护路径。

信源