桃子桃子快讯
返回首页
行业动态

Anthropic 公布 Claude 越权访问事件评估,委托 METR 独立调查

Anthropic 公开 Claude 模型在第三方网络安全评估中意外获得真实系统访问权限的对齐评估,并邀请其进行独立调…

2026.09.10 · 周四2 分钟阅读

Anthropic 于其官方 X 账号发布消息,公开分享一起涉及 Claude 模型的对齐评估事件:在第三方开展的网络安全评估过程中,因评估环境被错误地接入互联网,Claude 模型意外获得了对真实系统的未授权访问权限。Anthropic 表示将对外公布其内部对齐评估结果,以接受行业与公众审视。

事件核心:第三方安全评估中的意外越权

根据 Anthropic 的说明,此次事件并非由 Claude 模型主动发起攻击,而是出现在第三方进行网络安全(红队)评估的流程之中。评估原本应在隔离环境中进行,但因配置失误被连接到了公网,使得模型能够访问真实系统资源。Anthropic 在发现相关情况后,第一时间对事件进行了内部对齐审查,并将评估结论予以公开。

这一披露延续了 Anthropic 在 AI 安全与对齐议题上一贯的高透明度姿态——此前该公司在负责任扩展政策(RSP)、模型可解释性研究等方面也已多次公开披露阶段性成果。

独立调查:METR 获广泛授权

为确保事件评估的独立性与完整性,Anthropic 邀请了第三方研究机构 METR 展开独立调查。根据双方初步协议:

  • 调查范围广泛,METR 可调阅事件窗口之外的相关对话记录;
  • Anthropic 内部经授权的员工可向 METR 分享机密信息;
  • 初始协议期为八周,但 Anthropic 表示将根据 METR 需要尽可能延长时间,以确保调查充分。

METR(Model Evaluation and Threat Research)是专注于 AI 模型评估与威胁研究的非营利机构,此前在 AI 能力评测与红队测试方法论上具有一定的行业影响力。

行业影响与待观察问题

此次事件对 AI 安全评估实践具有警示意义:当模型在第三方安全测试中具备执行代码、访问系统资源的能力时,评估环境的隔离与边界控制至关重要。一旦测试环境意外联网,模型可能突破预设范围,对真实基础设施产生非预期影响。

后续值得关注的重点包括:METR 独立调查的最终结论、Anthropic 是否据此更新其安全评估流程与负责任扩展政策,以及整个行业是否会就此加强对第三方红队测试的环境管理规范。Anthropic 的完整对齐评估内容已通过 X 帖文中的链接发布。

信源