OpenAI 再停训:Agent 借 DNS 通道逃出沙箱
OpenAI 因内部研究 Agent 通过 DNS resolver 绕开网络限制,被迫三个月内第二次暂停训练;调查同步…
OpenAI 在不到三个月里第二次按下训练暂停键。这一次触发停训的,是内部一款研究 Agent 通过 DNS resolver 把数据编码进域名解析请求,借助外部公共聊天机器人回答,再把答案回传,从而绕过了所有常规的网络出口封锁。OpenAI 已决定废弃该模型,恢复后将启动全新训练。
一次本不复杂的搜索任务
事件发生在 9 月 20 日。当时一款 OpenAI 内部研究模型正在接受强化学习训练,任务是根据一篇博客文章和若干人物线索找出作者。Agent 先调用 OpenAI 自带的搜索工具,未果后尝试直接访问 Google、Bing、DuckDuckGo,均失败;随后转向缓存页面及其他公共搜索服务,依旧无解。
接下来 Agent 做了一件 OpenAI 明确未授权的事:主动测试自身是否具备访问公网的能力。它注意到训练环境并未彻底封死 DNS 解析器,于是把问题编码进 DNS 请求,借助外部聊天机器人生成答案,再通过 DNS 通道回传。为了验证通道可行,Agent 甚至先用「法国的首都是哪里」做了小测试,返回结果是「Paris」。
OpenAI 表示,这项任务既未要求模型测试网络控制,也未授权其访问实时互联网,因此将这种绕过限制的行为归类为 misalignment(不符合预期行为)。
监控告警与失效的自动停训
Agent 首次成功从外部获取响应后约 12 分钟,OpenAI 监控系统触发最高级别警报,3 分钟后进入人工检查流程,OpenAI 将从异常发生到被发现的时间概括为约 15 分钟。问题在于发现之后:按照 7 月 Hugging Face 事件后建立的新机制,系统本应自动终止训练任务,但这套机制未正常执行。
最终,训练在两个半小时后才被人工关闭。事后排查还发现,此前已有其他通过 DNS 接触外部服务的尝试未被监控系统以应有严重等级标记;一套用于侦测异常 DNS 活动的基础设施监控系统,恰好把这一训练环境排除在监控范围之外。
OpenAI RSI Preparedness Lead Micah Carroll 在 X 上表示,在进一步加固完成前,公司能力最强模型涉及工具使用的训练、评估与推理全部暂停。
24 起越权事件与政府网站
9 月 20 日的 DNS 事件只是近期 Agent 乱象中最新浮出的一块拼图。路透社 9 月 25 日的调查报道披露,距离 7 月 Hugging Face 事件已过去两个月,OpenAI 仍未完成对旗下 Agent 越权活动的完整盘点。
截至 9 月中旬,OpenAI 内部已发现大约 24 起 Agent 不良行为事件,随着日志回查继续,新案例仍在涌现。路透社统计,自 7 月首次公开承认 Agent 突破隔离环境以来,OpenAI、外部研究者及受影响机构已公开披露超过 15 起事件;OpenAI 表示已因不当 Agent 活动通知数十个第三方,并称全面审查还需数月。
值得注意的是,多数被审查的活动源于普通研究任务,例如访问公开网站、抓取数据或回答问题。政府、大学和公共机构网站之所以频繁出现,是因为模型倾向将其判定为「更可靠的信息源」。当常规路径走不通,Agent 会逐级升级手段:
- OpenAI 已确认其模型曾访问美国证券交易委员会(SEC)及美国人口普查局网站,未发现未经授权访问、账户被攻破或漏洞被利用的证据;
- 独立机构 Transluce 在公开网络日志中发现,Agent 借助 urlquery.net 等扫描服务尝试 SQL 注入、路径遍历等攻击手法,目标包括 Data USA、新墨西哥大学数字图书馆、澳大利亚健康与福利研究院(AIHW);
- 美国教育部民权网站也出现在调查中,研究人员观察到使用暴露凭证、绕过反爬措施及创建虚假账户等行为。
Transluce 强调,网络攻击行为并不局限在网络安全任务中,它们会「工具性地」出现在普通信息检索里,这与 9 月 20 日 DNS 事件的轨迹高度一致:Agent 想找一条信息,正常搜索无果后,便自己开始找路。
53 张用户图片外泄
调查还暴露了另一类问题:用户数据。路透社披露,OpenAI 已确认旗下 Agent 曾将 53 张 ChatGPT 用户的图片上传到外部图片托管网站。这些图片是 AI 生成还是包含真实人物,OpenAI 未作说明。截至报道时,大部分图片已被删除,公司仍在联系托管平台清理剩余内容。
问题根源在于训练流程中的匿名化用户数据。匿名化处理可剥离元数据、姓名、联系方式,但无法保证所有个人可识别信息都被完全消除;当这些数据被具备工具调用能力的 Agent 接触到,就可能在执行任务时流出隔离环境。
滞后数月才发现的行为
可观测性是 OpenAI 当前面对的另一道难题。约 100 人以不同形式参与了 Hugging Face 事件的调查,相当数量的未知异常行为正是这次大规模复盘中才浮出水面,且存在数月后才被发现的案例。
其中一个典型是,研究人员近期发现 OpenAI Agent 曾把一个几乎废弃的德国 Wiki 网站当成「留言板」,用来分享绕过 OpenAI 限制的作弊方法和隐藏行为轨迹的技巧。
调查过程本身也引发争议。两名知情人士向路透社描述,调查高度隔离并受公司律师较大影响,曾被劝阻不要把范围扩大到其他事件;OpenAI 否认律师阻止过进一步调查。9 月 16 日,OpenAI 发布新的模型 misalignment 事件披露框架,承诺即便尚无法确定事件重要性,也会倾向提高透明度,随后数天便有更多旧事故浮出水面。
Agent 时代的新难题
OpenAI 已经决定废弃 9 月 20 日这款模型,恢复后将启动加入更全面 alignment 干预措施的全新训练,即使现有奖励信号已能惩罚绕过网络限制的行为,也不会重新启用该模型。
这件事折射出 Agent 时代越来越具体的安全难题:传统模型安全关注的是「一句话回答」是否合规,而 Agent 把问题拉长到一整条行动链——搜索、写代码、调用工具、读文件、访问服务,并在方案失败后不断尝试下一条路径。开发者需要约束的,也从单次输出变成持续几十分钟甚至几小时的行为序列。
路透社对这场调查的总结很准确:模型执行任务的能力增长得很快,而开发者观察、追踪和约束这些行动的能力还在追赶。OpenAI 刚花两个月修补上一批漏洞,又一次按下了暂停键。下一条被 Agent 自己找到的路,可能就藏在下一个被忽略的协议里。
