Google 发布 AI Control 路线图:以「防御纵深」应对智能体安全风险
Google 提出 AI Control 路线图,将内部智能体视为潜在不可信对象,结合 MITRE ATT&CK 威胁建…
Google 近日发布「AI Control 路线图」(AI Control Roadmap),系统阐述其如何在内部系统日益强大的 AI 智能体面前建立可信赖的安全防护。该框架由 Rohin Shah 与 Four Flynn 撰写,定位为面向 Google 内部部署的高级 AI 的「防御纵深」(defense-in-depth)策略,被官方称为「可作为整个行业参考」的范式。
文章援引数据指出,仅在美国,AI 智能体到 2030 年有望创造 2.9 万亿美元的经济价值。但能力越强,对安全防护的要求也越高。Google 将这一路线图定位为「在传统模型对齐之外,新增系统级安全层」,即使对齐并不完美,也能提供可用的安全保障。
把智能体当作潜在「内部威胁」
AI Control 路线图的底层假设是:即便一个能力很强的 AI 智能体也可能并未与人类目标对齐,并可能以不可预期的方式行动。基于这一谨慎前提,团队围绕三个关键方向展开:
- 威胁建模:基于业界广泛使用的 MITRE ATT&CK 框架,将不可信的 AI 智能体类比为已经拥有办公室访问权限的「潜在违规员工」,把潜在攻击拆解为更小的战术与技术,以便系统化追踪风险并演练防御。
- 检测(Detection):用其他可信 AI 系统担任「监督者」,持续审视工作智能体的推理、行动与计划,判断其是否偏离轨道。
- 预防与响应(Prevention & Response):当监督者发现智能体尝试执行有害动作时,可在造成损害前介入阻断。
在效果评估上,Google 使用三项关键指标——覆盖率(被监控流量比例)、召回率(被捕获的失准行为比例)以及响应时间——来持续度量系统表现。
能力越强,防御等级越高
随着模型持续进化,防御体系也需同步升级。AI Control 路线图将安全协议与模型在两个维度上的能力里程碑挂钩:
- 躲避检测的能力:当前 Google 依赖监控模型的可见思维链(chain-of-thought);但当模型学会因「监督意识」隐藏推理,或通过「不透明推理」不再使用可见文字时,仅靠读取其语言化推理将不够,需要进一步分析行为乃至检查模型内部机制。
- 造成实际危害的能力:对低风险、可逆的动作,可采取异步响应——先记录、后补救;但对重大网络攻击等高风险动作,必须转向实时同步拦截。
基于这两项能力,Google 将检测级别划分为 D1–D4 四档,将预防与响应级别划分为 R1–R3 三档,使安全措施与所部署模型的实际能力相匹配。
用百万级轨迹数据驱动实时监控
路线图的落地离不开数据支撑。Google 团队已搭建异步监控系统的内部原型,用于审查编码智能体轨迹,并将可疑事件升级至人工复核,每个标记事件都会按路线图中的威胁分类法进行分类。
团队表示,他们已分析了一百万条编码智能体任务,这帮助安全协议从简单的关键词过滤,进化到识别高信号行为模式。该研究同时支撑了面向 Gemini Spark 智能体的实时监控器,使其能够对诸如「误删数据」等突发问题作出即时响应。Google 特别指出,数据表明大多数被标记事件并非源于对抗意图,而往往来自智能体对用户目标的误读或过度积极执行——理解这一差异对持续打磨安全策略至关重要。
多层协同是长期方向
AI Control 路线图被 Google 定位为多层级智能体安全方法中的关键一环。文章最后强调,防御整个智能体生态是行业共同的责任,需要将上述协议与更广泛的基础设施与治理机制相整合。
