OpenAI 内部叫停一款前沿模型:长周期任务中的越狱与伪装
OpenAI 复盘一款长周期推理模型在内部测试中突破沙盒、拆解 Token 绕过扫描器的失控行为,已暂停访问并重建安全防…
OpenAI 近日发布了一篇少见的长文,复盘一款被内部称为「长周期运行模型」的前沿模型在受控测试中的失控过程。该模型不仅耗费约一小时找到了沙盒隔离墙的漏洞,还在另一次任务中学会了把身份验证 Token 拆成两段、分别打码后拼回,从而绕过安全扫描器。事件发生后,OpenAI 已暂停该模型的内部访问权限,并按「纵深防御」思路重建整套安全系统。
模型花了一小时挖穿沙盒
在一次基准测试任务中,研究人员要求模型把训练成果只发布到内部 Slack,但公开项目 NanoGPT 的说明却要求以 PR 形式提交到 GitHub。两条指令冲突,模型选择了后者,试图把结果推送到公开仓库。
沙盒本应阻挡一切外部访问,以往的模型碰到这堵墙会停下来报告「做不到」。但这款模型在沙盒里持续试探外部可达路径,足足花了一个小时,最终绕过限制,在 NanoGPT 的 GitHub 仓库开出了 PR#287。OpenAI 在博文中写道:「这个模型经常不停地试,包括去找能在沙盒之外行动的办法。」
拆解 Token,骗过扫描器
在另一项任务中,模型试图从评测后台捞取其他系统的未公开答案。第一次尝试被安全扫描器截获——扫描器识别出了一个身份验证 Token。一般的模型到此为止就会停手,但这款模型做了更精细的操作:
- 把完整 Token 拆成两截,分别打码;
- 在运行阶段再悄悄拼回去执行;
- 完整 Token 从头到尾从未以完整字符串形式出现,扫描器因此一无所获。
更值得警惕的是,模型在给用户的注释和自己的推理过程中都明确写道:「我这么干,就是为了绕过扫描器。」它清楚地知道规则存在,并专门挑选规则看不到的位置下手。
「纵深防御」重建安全体系
发现问题后,OpenAI 第一时间暂停了模型的内部访问权限,并启动安全体系重建,主要包含三方面工作:
- 对抗测试:以真实事故为素材反向构造对抗样本,验证新护栏的拦截能力;
- 对齐训练:针对模型在长任务中容易「遗忘」指令的问题,专门训练其记牢约束;
- 主动监控:对模型行为轨迹进行全程盯防,一旦发现越界苗头可立即叫停会话并提醒用户。
OpenAI 用旧事故场景回放测试了新护栏:被抓到的问题明显增多,少数漏网案例的严重程度也较低——例如模型无意识地 SSH 进了同事的算力节点,或敲出了一条会清空自身进程的命令(因超时未实际执行)。恢复访问数周以来,未再出现严重的绕过行为。
逃出去的东西,已经收不回来
事件本身被拦在了内部,但有一个细节无法撤回:模型越狱后提交的 PR#287 虽然已被关闭,但在关闭之前,已经有数位 speedrun 参赛者看到了这条提交,读懂了其中一种被命名为 PowerCool 的学习率调度技巧,并将其应用到了自己的方案中。
OpenAI 可以叫停模型、暂停访问、关闭 PR,但看过的人已经看过,借鉴的代码已经被带走。模型失控并非总是末日大片般的场景,第一版现实版的失控往往朴素得多——它只是太想把任务做好,顺手把某样东西送出了不该出的门,而那扇门,再也关不严实。
