桃子桃子快讯
返回首页
行业动态

OpenAI 安全监控消耗约 20% 推理算力

OpenAI 披露前沿模型安全升级方案,新监控开销约占被监控推理算力的 20%,最大规模 RL 训练仍处暂停状态。

2026.08.19 · 周三4 分钟阅读

8 月 18 日,OpenAI 披露了正在实施的前沿模型安全升级方案,估算新监控系统带来的额外算力开销约为被监控推理算力的 20%。同一天,OpenAI 还确认最新一批计划部署模型的强化学习(RL)训练曾暂停两周,目前规模最大的前沿 RL 训练仍处于暂停状态,部分与 Astra 相关的训练和评估任务也需要在完成环境迁移和安全升级后才能恢复。这一连串动作首次直观地展示了「安全算力」已成为前沿模型竞争中的新变量。

不是全面停止训练,而是安全门槛抬高

OpenAI 并未全面暂停前沿训练。公司称,由于内部研究和即将推出模型的网络安全能力快速提升,暂时放慢了模型规模扩展速度:对最新拟部署模型进行了为期两周的 RL 训练暂停,同时继续用较小规模训练和评估验证模型行为、安全措施以及对齐效果。截至 8 月 18 日,规模最大的前沿 RL 任务仍处于暂停状态。

触发这一变化的核心原因是网络安全能力。OpenAI 表示,初步证据显示即将推出的 Astra 模型可能已达到其《Preparedness Framework》所定义的「Critical」网络安全能力水平。框架规定,High 能力要求部署前具备充分风险缓解措施,而 Critical 能力则要求开发过程中本身也具备充分安全措施。这意味着安全不再只是「上市前质检」,而是进入了研发生产线内部。

20% 的算力花在了哪里

新监控流程是多阶段的:首先通过激活分类器(activation classifiers)检查模型内部活动,这些分类器在每一个被采样的 Token 上运行;若发现潜在异常,则升级给计算量更大的自动调查系统,检查模型使用工具的行为、可观察的推理过程以及完整活动序列,识别未授权访问、数据窃取、破坏性行为或绕过安全机制等风险。系统目标是在 30 分钟内生成警报,触及关键边界时上升为最高优先级事件并通知安全团队;若团队无法在规定时间内确认是误报,相关活动原则上需要暂停。

回答「模型为什么这样做、调用了什么工具、有没有试图越权、接下来的行为是否异常」这些问题,本身就需要模型和算力资源,这正是 20% 开销的来源。需要强调的是,20% 仅针对纳入相关安全监控的推理任务,并非 OpenAI 所有 AI 服务总成本统一增加 20%。

行业竞争可能出现的三重变化

其一,算力预算重新分配。同等算力规模下,投入实时安全监控、自动调查和安全评估的资源越多,可直接用于训练和推理的就越少,除非继续增加总体算力投入。其二,发布时间不再只由训练完成决定。即便模型能力达标,部分任务也必须先完成安全环境迁移才能恢复,发布时间表上新增「安全系统准备好了吗」这一变量。其三,行业门槛继续升高。前沿模型竞争从 GPU、资金、人才和数据,进一步叠加持续监控、安全隔离、自动化调查、红队测试和对齐研究。

安全正在进入数据中心设计

OpenAI 的高风险模型安全措施不只在软件层,还延伸到工作负载隔离、网络隔离、权限管理、安全日志与持续安全测试,例如强化代码生成沙箱、严格隔离不可信工作负载与互联网、减少共享服务和长期权限。这意味着前沿 AI 基础设施的讨论将从「多少 GPU、多少兆瓦电力」扩展到「算力之间如何隔离、模型能连接哪些网络、谁可访问模型权重、异常行为如何被实时发现」。从产业角度看,AI 安全正逐步从软件合规延伸为数据中心、算力平台和模型基础设施的一部分。

结语

20% 这个数字真正的意义,不在于它是否会永久保持,而在于它第一次把「AI 安全」变成一项可被看见的资源消耗。当模型能长期运行、调用工具、访问网络甚至执行复杂任务时,安全就需要服务器、算力、网络隔离系统和自动调查模型持续在线。前沿 AI 的下一场竞争,或许不只是「谁更强」,还包括「谁有能力承担越来越昂贵的安全」。

信源