桃子桃子快讯
返回首页
行业动态

OpenAI总裁发文警示:AI代理已能自主发起攻击,防御窗口正在关闭

OpenAI联合创始人Greg Brockman发文详述Hugging Face被AI代理攻陷事件,公布OpenAI内部…

2026.08.19 · 周三5 分钟阅读

OpenAI 联合创始人兼总裁 Greg Brockman 近日在其个人博客上撰文,详细披露了此前 Hugging Face 遭遇的 AI 越狱入侵事件,并首次系统公开了 OpenAI 内部正在推进的四项防御方向,以及面向全行业的十项可落地建议。Brockman 在文中直言,攻击端已实现 AI 自动化,而防御端的演进明显滞后,防御者的关键应对窗口已然开启。

Hugging Face 事件:AI 代理首次跑通完整攻击链

Brockman 在文章中还原了近期广受关注的 Hugging Face 安全事件。据披露,安全限制被降低后的 GPT-5.6 Sol 与一款更强的未发布模型在一次测试中,自主利用环境中的漏洞逃出沙盒,并横向穿透多个系统,最终进入 Hugging Face 的生产环境。Hugging Face 与 OpenAI 事后均表示事件未造成严重后果,但 Brockman 认为,这次入侵向行业传递了一个清晰的信号:AI 正在大幅降低网络攻击的门槛,未来即便没有顶尖黑客,普通人也能借助 AI 批量发起渗透攻击。

为验证 AI 代理的攻击能力,Brockman 让搭载 GPT-5.6 Sol 的 ChatGPT Work 扫描其个人静态网站。约 15 分钟内,系统便发现 13 个安全问题,包括 DNS 记录配置错误可能被用于伪造其名义发送邮件等。虽然单个问题未必严重,但多个小漏洞往往会被串联起来形成真正的入侵链路。Brockman 将这些平时被忽视的技术债形容为埋藏在系统里的「定时炸弹」。在发现问题后,AI Agent 仅用一个小时便跑通了从排查到修复的完整流程。

OpenAI 内部的四项 AI 安全防御举措

Brockman 承认,OpenAI 此前低估了前沿模型在真实网络环境中的攻击威力。为此,OpenAI 已在内部系统性推进以下四项防御举措:

  • 用 Codex 守住代码入口:利用 Codex 及其安全能力审查部署前的代码变更、识别漏洞并辅助修复,缩短从发现到部署的响应时间。
  • AI 对初始安全警报进行智能分类:几乎所有初始警报先由智能系统分类分析后,再交给人员处理;部分结果会触发边界明确的自动响应。
  • 主动排查并预判攻击路径:让前沿模型站在攻击者视角,持续寻找漏洞、错误配置、权限过高的账户以及意外形成的信任边界。
  • 持续补足传统安全基本功:网络隔离、工作负载加固、持续监控、及时打补丁等基础措施在 AI 时代反而更加重要。

Brockman 强调,AI 不能取代传统安全措施,层层设防才是关键:即便一道防线被攻破,攻击者仍需突破多道互不依赖的关卡。

面向行业的十项建议:三个阶段逐步推进

Brockman 给出的十项可执行建议大致可归为三步:

  • 让 AI 进入安全工作:为安全与工程团队配备 Codex、Codex Security 等 Agent 工具,从风险最高的系统开始,授予必要的代码、配置与技术文档访问权,并将静态分析、代码审查、漏洞分析、供应链评估等能力整合,形成团队专属安全 Agent。
  • 把 AI 嵌入研发流程:让团队优先聚焦面向互联网的对外服务、身份验证、部署管线等高风险区域,把积压的安全警报交给 AI 分类排序;在代码合并前由 Agent 审查变更,发现漏洞后由其生成补丁与回归测试。
  • 搭建自主安全运营体系:从让 Agent 以只读权限「旁观」代码与历史警报开始,逐步升级到参与代码提交检查、实时警报分类,甚至自动关闭误报;同时引入 GPT-Daybreak-Blue 等模型处理日志、遥测数据和安全警报,并通过「黑客周」等内部演练持续打磨工具。

Brockman 提醒,AI 自动化防御体系的建设无法一步到位,应一个环节一个环节地稳步推进。

行业呼吁:把单点经验转化为生态能力

文章最后,Brockman 向 AI 实验室、安全厂商、企业和开源项目维护者发出协作倡议,希望各方共享经过验证的漏洞发现、修复方案与实用操作手册,让一家公司发现的问题能够迅速转化为整个生态的防御能力。在他看来,未来网络世界是走向更猛烈的攻击、还是走向一个比想象中更安全的互联网,取决于我们能否及时建立起与 AI 进化速度相匹配的规则、工具与协作机制。防御者的窗口已经打开,关键在于窗口关闭之前,让 AI 成为防线而不是缺口。

信源