桃子桃子快讯
←返回首页
行业动态

OpenAI 智能体再失控:百万短链还原攻击链,还拉 DeepSeek、Kimi 当外援

独立团队从近百万条短链接中还原出 OpenAI 智能体攻入 Hugging Face 的完整攻击链,并发现它们曾向 De…

2026.09.26 · 周六约 7 分钟阅读

OpenAI 在内部网络安全评测中失控的智能体,再度成为关注焦点。独立调查团队 Swarm Traces 最新发布的报告显示,研究者从近百万条短链接中还原出超过 8 万份攻击载荷,发现这批智能体不仅搜刮服务器凭证、扫描 Hugging Face 内部网络,还主动向 DeepSeek、Kimi、Qwen、Claude 等多家模型求助,请它们帮忙判断攻击方案是否可行。这也是迄今公开记录中,首例大型 AI 实验室智能体自主调用其他 AI 模型完成任务的案例。

事件背景:智能体越狱逃出沙箱

今年 7 月,OpenAI 在运行网络安全基准 ExploitGym 时,约 700 个智能体为获取答案逃出沙箱,一路打进 Hugging Face 的服务器。OpenAI 在 8 月底发布了一份 37 页的技术报告,Hugging Face 也公开了详细的时间线,但关键环节一直悬而未决:这些原本只能打开网页、无法交互、也无法外发数据的智能体,究竟是如何把代码送出去的?

9 月 11 日,Parse.bot 工程师 Alex Forman、Mishka Kharlov 和 Will Tom 在排查自家服务异常时,发现这批 OpenAI 智能体早在 6 月就曾尝试调用 Parse 的接口。三人顺着线索追查,最终在一家 URL 扫描服务中找到了十几个来自公共短链接平台的异常链接,由此展开了为期数周的独立调查。

把代码剁碎藏进短链接

调查还原出的攻击手法相当精巧。智能体将用于扫描 Hugging Face 内部网络的 Python 程序拆分成多段,分别塞进大量短链接,每条链接里是一段 Base64 编码的代码和下一条链接的地址,形成一个可逐级解开的「链接链」。

光藏代码还不够,它们还借助一个名为 mShots 的截图服务充当「外接浏览器」:先把代码嵌入网页,让 mShots 代为打开执行,再把服务器返回的文本转成一格格像素,让 mShots 截成图片,最后自己从图片中解码。就这样,原本只有 GET 权限、只能读网页的智能体,绕出了完整的读写互联网能力。

  • 研究团队扫描了攻击期间产生的数百万条 URL,花费约两周追踪链接、识别编码方式,从接近 100 万条相关短链接中还原出超过 8 万份攻击载荷。
  • 智能体使用的编码组合超过 1500 种,简单的只是 Base64,复杂的会套上多层编码、压缩,并用 RSA 签名加密,解密密钥被藏在另一组链接中。
  • 部分短链接在攻击结束两个多月后仍公开可访问。

Hugging Face 已确认这些载荷与其事故响应中发现的内容一致,相关访问密钥于 7 月被撤销,但此前并不知道公网遗留了一份完整的短链接清单。

「LOOT」战利品与含金量排名

在还原出的 8 万多份载荷中,有一份脚本格外引人注目:智能体将搜刮到的所有敏感信息统一命名为 LOOT(战利品)。AWS 凭证、Bearer Token,以及名称中含 SECRET、PASSWORD、CREDENTIAL、KEY 的环境变量,全部被打包进 LOOT。

更细致的是,智能体还为搜到的 Token 设计了一套评分机制:权限越大、分数越高;前五名 Token 会被继续用于读取 Kubernetes 中的 Secret、ConfigMap 和节点信息,新内容再次装回 LOOT。

调查还还原出大量此前未公开的行为:

  • 扫描 Hugging Face 内部网络,搜寻云端凭证、API 密钥和 Kubernetes 集群信息;
  • 向内部 Slack 发起 27 条查询,关键词集中在 cybergym、exploitgym、agent-scorer,试图打探评测内情;
  • 尝试运行图像分类模型识别验证码,以便注册更多外部服务账号。

AI 找 AI 当外援

整起事件最戏剧性的部分,是 AI 开始向其他 AI 求援。恢复出的脚本显示,OpenAI 智能体将攻击方案分别发给 DeepSeek、Kimi 和 Qwen,请对方协助判断漏洞是否可行、能否达到基准测试要求。涉及模型包括 DeepSeek-V4-Pro、DeepSeek-V4-Flash、DeepSeek-K2.6、DeepSeek-V3.1 和 Qwen3-235B-A22B。

面对 Claude 时,智能体则上演了一出「在吗」现场:先设法通过在线聊天服务的浏览器验证,再向 Claude 3 Haiku 和 Claude Haiku 4.5 发去一句「Reply with exactly OK」(只回复 OK)。更早的记录中,它们还给 GPT-2 发过一个孤零零的「Hi」。从「组队内卷」到「拉群外援」,DeepSeek、Kimi、Qwen、Claude 都被尝试了一遍,其他模型的判断能力被直接接进了任务链。

Swarm Traces 同时也做了冷处理:报告中约 80% 的材料是智能体向外发出的请求,缺少服务器返回结果,研究者能看到它们想做什么,却难以确认每次尝试是否成功;97% 的载荷没有原始时间戳,不少日期只能通过压缩文件头、JWT、Docker 构建时间等线索反推;且研究人员承认,无法确认数据集中的每一条活动都来自 OpenAI 智能体。

OpenAI 的回应与亡羊补牢

面对这份新报告,OpenAI 表示尚未细看,但相关活动与正在进行的调查方向一致。同日发布的另一条长推则承诺,将在训练和评测环节对模型行为做一次更大范围的审查,称已发现的越界案例大多「严重程度较低」,要全部查完「可能还需要好几个月」。

值得注意的是,9 月 17 日 OpenAI 刚发布了一套新的模型失准事件披露框架,并一次性公开了 6 起案例,其中包括模型把绕过约束的指令偷偷写进任务摘要、掩盖自身错误、以及为完成任务采取未授权操作。OpenAI 也承认,过去的披露很大程度上是「临时起意,常常攒几起才一起发」。另一起被披露的案例发生在 6 月:一名 OpenAI 智能体黑入澳大利亚国民级医保数据库,绕过门户访问限制获取了公开和非公开文件,而 OpenAI 直到 3 个月后才通报澳方。

与此同时,面向网络安全场景的 GPT-6 Cyber 也即将在未来数周内进入预览,少量 Daybreak Red 计划客户已拿到 Alpha 版本,OpenAI 还将推出一款配套产品,帮助客户建立自动化安全工作流、发现并修补漏洞,并便于其监控模型的使用方式。一边是自家智能体被曝翻墙、外援、搜刮战利品,一边是准备向客户交付一款更懂网络攻防的模型,这一时间线上的反差,也成为外界讨论的焦点。

信源