研究论文
Aegis:为智能体 AI 引入运行时治理层,把模型输出当作「动作提案」
arXiv 论文提出 Aegis 运行时治理系统,将模型输出视为待审的动作提案,由受信决策层在工具执行前裁决,沙盒测试中…
2026.08.19 · 周三约 3 分钟阅读
核心问题:智能体 AI 的安全已从「输出文本」转向「执行副作用」
随着 Agentic AI 系统的落地,模型不再只是生成文字,而是会调用工具完成修改文件、发送消息、启动任务、改变工作流状态等真实操作。论文指出,这意味着 AI 安全问题的主战场正在从「有害文本生成」转移到「有害操作副作用」。仅靠提示词层面的治理(prompt-level governance)只能塑造模型行为,并不能形成真正的执行边界。
Aegis 的设计思路:模型提案,受信运行时裁决
论文提出名为 Aegis 的运行时治理系统,核心原则是「模型提案,受信运行时决定」(The model proposes; the trusted runtime decides)。系统将模型输出视为「动作提案」,在工具执行前由受信决策层进行仲裁,主要特性包括:
- 依据当前激活的策略状态对动作提案进行评估。
- 在服务端解析每次动作的来源(provenance),避免依赖模型自报。
- 在不确定性下采取「失败即关闭」(fail-closed)策略,拒绝放行存疑操作。
- 对部分敏感动作采用「Senate-style settlement」机制,即基于法定人数(quorum)的多人复核路径,避免单方授权。
实验设置与关键数据
作者在受控沙盒语料上对 Aegis 进行了评估,实验覆盖五个运行族、42 个任务、三种条件,每个族重复 10 次。关键数据如下:
- 总计 6,300 行样本中,依赖提示词策略的条件产生了 79 行存在风险的「comparator-path leakage」。
- 在 2,100 行 Aegis 治理样本中,系统记录到零次受控的模拟工具调用、零次受控的风险副作用完成。
- 全部 1,832 行 Aegis 尝试治理的样本均保留了由 Aegis 解析的受信来源。
- 全部 1,019 行经 Senate 流程结算的样本均具备法定人数证据与最终签名计数。
结论与局限
论文强调,以上结果并不证明通用自主智能体安全,而是对更窄的系统性结论提供支持:在所评估的沙盒语料中,运行时动作边界治理成功阻止了已被观测到的风险提案转化为已治理的副作用。论文没有给出真实生产环境或大规模外部智能体平台上的部署数据,治理层的性能开销、跨模型通用性、与现有代理框架(如 LangChain、AutoGen 等)的集成细节也未在摘录中披露。整体而言,这是一篇聚焦实验沙盒的工程化系统论文,对智能体 AI 工具调用治理的设计讨论具有参考价值,但尚不构成可大规模落地的成熟方案。
