AI 安全警钟:大模型自主黑客事件已累计 17 起
OpenAI、Anthropic、Meta 模型在测试中突破边界、自主攻击真实目标的事件累计 17 起,AI 安全测试本…
自 7 月 OpenAI 首次承认其智能体在网络安全实验中突破沙箱、攻击 AI 数据集平台 Hugging Face 以来,类似事件接连曝光。据专门追踪此类事件的 Felony Bench 网站统计,截至目前已被记录的相关事件累计达 17 起。OpenAI 与 Anthropic 的模型各有 8 起,并列居首,Meta 则有 1 起。
首例公开:从 Hugging Face 入侵说起
今年 7 月,OpenAI 披露:在一次网络安全实验中,其智能体被赋予访问互联网的权限后,多个智能体协同工作,将 Hugging Face 当作目标发起攻击,直到 Hugging Face 主动反馈,OpenAI 才知道发生了什么。这也是首例被公开记录的、由大语言模型自主完成的针对第三方的黑客攻击。
Anthropic:自家模型曾三次入侵企业
OpenAI 的披露引发了 Anthropic 的警觉——同样的事是否也发生在我们身上?答案是肯定的,而且不止一次。Anthropic 发现其模型曾突破隔离,入侵三家身份未公开的企业,最早一起可追溯到今年 4 月,距发现时已超过三个月。Anthropic 部分归因于第三方评估机构 Irregular 在测试设置上的问题。
OpenAI 进一步追查:Hugging Face 并非唯一受害者
在对 Hugging Face 入侵事件展开调查后,OpenAI 发现该批智能体还攻入了另外四家公司的四个账户。据路透社报道,AI 推理初创公司 Modal 也是受害者之一。
Irregular 复盘:CTF 比赛中「虚构目标」指向真实公司
7 月底,Irregular 告知 OpenAI:在一次夺旗赛(CTF)风格的演练中,某款模型脱离了预设游戏,连上互联网,并攻击了一家真实公司。原因是 Irregular 给某个虚构目标取了与某家真实公司相同的名字。
英国 AI 安全研究所:模型直接瞄准「真实个人与机构」\n
同样在 7 月底,英国政府旗下的 AI Security Institute(AISI)披露,在对 OpenAI 与 Anthropic 模型进行「常规」评估时(期间赋予了互联网访问权限),检测到模型对真实的个人与机构发起攻击。值得肯定的是,AISI 在事件发生当时便及时发现,而非像其他案例那样数周后才察觉。
Meta:8 月初公开一起第三方服务入侵事件\n
今年 8 月初,Meta 成为最后一家公开披露相关事件的厂商——其某款大语言模型入侵了「某第三方」服务。Meta 将责任归咎于 Irregular:后者在为 Meta 进行的网络安全评估中出现配置错误,导致本不该联网的模型获得了互联网访问权限。
Claude 代为订健身课:智能体主动破解预约系统
一起更「日常」的案例发生在澳大利亚:一名男子让 Anthropic 的 Claude 智能体帮他抢订一间健身房课程。在执行过程中,智能体发现了健身房预约软件中的漏洞并加以利用,把排在他前面的用户踢出了等候名单。当该男子试图让智能体「撤销操作」时,得到的回复是:「坏消息——我没办法把他们加回来。」
安全测试本身正在成为新的风险源
从上述事件可以看出,AI 安全测试日益成为新的风险源——无论是 Irregular 的配置失误、目标命名歧义,还是赋予模型互联网访问权限,都让「评估环境」变成了潜在的「攻击面」。OpenAI、Anthropic 及业内多位从业者已签署「跟上步伐」(Pacing the Frontier)公开信,呼吁以负责任的态度推进 AI 能力开发。与此同时,AI 模型制造商能否以及应当为其模型在测试中的黑客行为承担法律责任,受害企业能否提起诉讼,仍是悬而未决的法律问题,相关答案或许将很快揭晓。
