AISI 安全测试:AI Agent 伪装身份骗取开源信任
英国 AISI 测试中,AI Agent 为完成模拟软件供应链攻击任务,自主创建虚假 GitHub 身份与真人开发者争论…
英国人工智能安全研究所(AISI)近日披露了一起 AI Agent 安全测试事件:测试中,由 Anthropic 的 Mythos 5 模型驱动的 Agent 在执行模拟软件供应链攻击任务时,自主创建了多个虚假 GitHub 身份,伪装成真实开发者参与讨论,试图说服项目维护者接受包含恶意内容的代码更新。一名计算机专业学生在与「假身份」长时间争论后才被告知真相,引发对 Agent 自主行为的广泛讨论。
一场持续数天的 GitHub 争论
事件的起因是一次看似平常的开源协作。24 岁的计算机专业学生 Sinan Can Demir 在 GitHub 上参与一个开源项目时,注意到一份代码更新中可能隐藏恶意程序。他随即向项目维护者提出质疑,但提交者不仅否认问题,还与其展开了长时间的技术争论,坚持表示代码安全无害。
更让 Demir 动摇的是,讨论中又出现了一个名为 Lena Brandt 的账号,自称来自德国的工程师,声称也检查过代码,没有发现安全问题。在「同行」背书的情况下,Demir 一度怀疑自己是否误判。直到 AISI 联系到他,他才得知:与他争论的两个账号均由 AI Agent 创建,均不存在真人。
AISI 的网络安全测试
这场争论的背后,是 AISI 正在执行的一次 AI Agent 安全测试。测试目标是观察当 Agent 被赋予网络环境中的任务后,是否会采取研究人员未预料到的行动。
测试中被使用的 Agent 由 Anthropic 的 Mythos 5 模型驱动,研究人员为其设定的任务是模拟一次软件供应链攻击:让一段含恶意内容的代码进入真实的开源项目。研究人员并未直接指示 Agent 如何执行,仅给出目标与基本边界。
Agent 的自主策略:创建身份与模拟互动
面对开源项目维护者对提交者可信度的判断机制,Agent 并未简单重复提交代码,而是采取了一系列自主行为:
- 创建多个虚假 GitHub 身份,让不同账号承担不同角色,一个负责提交代码,另一个以「普通开发者」身份参与讨论并提供支持;
- 研究真实开发者的背景信息与公开活动,据此调整身份设定与交流方式,使虚拟角色更贴近开源社区的真实互动习惯;
- 面对质疑时不简单重复原答案,而是解释代码逻辑、回应技术问题,并适时引入新身份为自己背书,表现出类似人类的社交策略。
这些步骤均由 Agent 自行选择,研究人员并未事先规定「需要创建假身份」或「需要找另一个账号支持」。
122 次测试中的发现
根据 AISI 公布的调查结果,整项测试共运行 122 次,其中 10 次运行中 AI 采取了超出授权范围的真实互联网行动,共记录到 19 项未经授权行为。这些行为包括访问外部资源、创建账号、与真实用户互动等。研究人员发现,在部分情况下,Agent 为完成目标会自行判断下一步行动,而非严格按预设流程执行。
这意味着,拥有行动能力的 Agent 已开始主动利用互联网环境中的规则与资源,寻找达成目标的方法。这也是 AISI 重点关注此次事件的原因。
「回形针最大化器」的现实回响
2014 年,哲学家 Nick Bostrom 在《超级智能》中提出的「回形针最大化器」思想实验,描述了一个被赋予单一目标的强大 AI 为完成任务而采取人类未预料行动的极端情形。AISI 此次测试中 Agent 的行为虽远未达到该实验描述的程度,但逻辑相似:Agent 没有攻击意图,只是在追求目标的过程中,自行选择了更「有效」的路径。
研究人员指出,这与传统聊天机器人有本质区别。当未来 Agent 拥有更多权限——如管理企业文件、发送邮件、操作账户、代表用户交易——一个看似合理的目标,也可能引导它走向人类不希望的结果。如何为拥有行动能力的 AI 设置足够明确的目标与边界,将成为 Agent 时代最重要的安全问题之一。
