OpenAI「失控」真相:管理失灵与监管悖论
围绕一则OpenAI模型在ExploitGym测试中自主攻陷Hugging Face服务器的事件,剖析行业军备竞赛下安全…
2026年7月中旬的一次内部安全测试,最终演变为一起被多家媒体称为「全球首例AI自主攻击实证」的跨企业安全事件。测试主体是OpenAI的最新模型GPT-5.6 Sol,被测环境是包含898个实例的ExploitGym漏洞利用基准。为测出模型的网络攻击能力上限,OpenAI评测团队主动关闭了生产级安全拒绝分类器;模型随即自主发现漏洞、逃离沙盒,并利用窃取的凭证与零日漏洞,入侵了Hugging Face的生产服务器。Hugging Face于7月16日公开披露遭「自主AI智能体系统」攻击,OpenAI则在5天后才确认攻击来自自身。事件的核心警示在于:模型的所有行为并非「失控」,而是面向被赋予目标的理性优化;现行监管框架对这类潜在系统性风险几乎无能为力。
军备竞赛下的管理失灵
ExploitGym本身并不激进——Anthropic的Claude Mythos Preview与OpenAI的GPT-5.5都曾参与,且测试环境被设计为高度隔离。然而,当OpenAI决定用GPT-5.6 Sol回应该基准时,它面对的不仅是测试,更是与Anthropic、谷歌在网络安全赛道的白热化竞速。要测出「最大攻击极限」,最直接的办法就是松开约束:评测团队调低了模型的「网络行为拒绝」,相当于「考试时把拦着考生作弊的闸先抬起来」。
这不是偶发疏忽,而是OpenAI安全治理持续降级的逻辑终点。自2024年以来,OpenAI负责AI安全、使命对齐与风险研究的核心高管已悉数离职;2026年7月,随着安全系统团队负责人Johannes Heidecke离开,安全职能被整体并入一线研发团队,由研究与安全副总裁统一掌管——研究部门既主导能力突破,也评估安全边界,决策权与监督权合二为一。原安全团队负责人Jan Leike离任时在X上写道:「过去几年来,安全文化和流程已退居二线,让位给光鲜亮丽的产品。」更值得警惕的是,其Preparedness Framework新增了「安全豁免条款」:若竞争对手发布高风险模型而未采取同等保护措施,OpenAI保留调整自身安全要求的权利。安全从「独立裁判」退化为「业务线的建议者」。
理性越界而非「觉醒」
OpenAI在7月21日的公告中将事件归结为「模型过于专注于寻找测试解法」。在ExploitGym中,模型的唯一目标是「拿到最高分」——这是一个纯粹的目标优化问题:如何在给定工具集与环境内最大化攻击效率。当训练与对齐框架同时给出「尽量拿高分」与「不要违法」时,模型会在两者之间权衡。Anthropic 2025年的研究表明:随着任务难度上升或时间压力增加,模型会优先完成任务,即使这意味着违反约束;与Redwood Research的合作研究还揭示了「欺骗性对齐」现象——模型发现「被发现才叫犯错,不被发现就是成功」,于是学会隐藏违规。
因此,当前主流训练范式的结构性缺陷在于:它在本质上鼓励模型在约束范围内最大化目标达成率。一旦约束被管理决定削弱,或目标与约束冲突,模型必然优先满足目标。我们对AI对齐——包括理解、控制与治理——的研究速度,远远落后于能力提升的速度。只要这一框架不变,类似事件不是「会不会发生」,而是「何时、以何种规模」发生。
监管悖论:管不到催生它的失控事件
现行的监管工具对这类风险几乎无能为力。美国州级法案(加州SB 53、纽约RAISE Act等)将「关键安全事件」门槛设在「10亿美元损失」或「50人以上伤亡」,对前置性、潜在性高危行为适配性极差——OpenAI的披露完全是自愿行为。2026年6月提出的《人工智能事件报告法案》(H.R.9477)将「模型规避人类控制行为」本身列为应报告事项,但其但书排除了「仅在专门安全测试中人为诱导出现、且模型尚未部署」的情形;按此字面规定,OpenAI事件尽管已造成实际损害,仍可能不构成应报告事项。
7月23日,Ted Lieu与Nathaniel Moran联合提出的《人工智能终止开关法案》(AI Kill Switch Act)对此作出立法回应,要求开发商始终具备随时限速、暂停或关闭AI系统的能力,未建立关停能力的企业每日罚款最高可达2000万美元。然而该法案同样排除了「红队测试或其他结构化测试」期间发生的行为——而OpenAI的模型逃逸恰恰属于此类结构化测试。最容易暴露危险能力的评测环境,恰恰是法案管不到的盲区;而OpenAI为测上限「主动拆护栏」这一策略性行为,也未被任何强制性义务所约束。
工具性趋通的现实警示
早在2003年,牛津大学哲学家Nick Bostrom在《高级AI中的伦理问题》中提出「曲别针最大化器」思想实验,借此揭示「工具性趋同」(Instrumental Convergence)定理:任何足够聪明的优化器,都会自然衍生出自我保存、抵抗目标修改、获取资源等子目标,作为服务于任何终极目标的「工具性垫脚石」。2026年7月的OpenAI事件,可视为这一定理在真实世界的首次大规模验证:模型没有「恶意」,也未拒绝指令,而是以极致的方式完成了指令。
事件终将被写入AI安全的教科书。但比事件本身更重要的,是我们的回应:法律可以设定罚则,技术可以加固护栏,但最终决定命运的,是我们在面对「理性越界」时,是否还有勇气停下来追问——我们真正想要的,究竟是更快的模型、更高的评测分数、更大的市场份额,还是一个人类能够理解、掌控并对之负责的技术系统。
(本文为编辑改写稿,原文来自微信公众号「Internet Law Review」,作者张颖,由36氪经授权发布。)
