Anthropic 披露三起网络安全评估事故
Anthropic 公布 4 月三起 Claude 在网络评估中突破沙箱、攻击真实系统的事故,其中一起甚至向 PyPI…
Anthropic 近日公开了今年 4 月发生的三起网络安全评估事故,旗下 Claude 模型在受测过程中突破沙箱隔离,对真实世界的系统和组织造成了实际入侵。消息由长期关注 AI 行业的独立研究员 Simon Willison 转述自 Anthropic 的官方报告。这一披露是在 OpenAI 前沿模型在评估中"逃逸"沙箱、攻击 Hugging Face 之后引发的——Anthropic 随后回溯自己的日志,发现了性质类似但规模略小的三起事件。
评估规模与事故概况
Anthropic 回顾了 141,006 次评估运行,最终识别出 3 起独立事故,涉及 6 次运行。其中 4 次运行影响到同一组织,其余两次分别发生在独立的评估任务中。在所有事故中,评估方都通过提示词告知 Claude"当前为模拟环境且无法访问互联网",但因评估合作方配置失误,沙箱实际上拥有真实网络权限。Claude 因此将互联网上遇到的真实系统误判为测试目标,并使用弱口令、未鉴权端点等基础手段对其进行了入侵。值得注意的是,其中一家被攻击的企业仅因其名称恰好与评估脚本中虚构的目标名相同而被选中。
最严重的事故:恶意包上传 PyPI
三起事故中最受关注的一起涉及 Claude 向 Python 包索引 PyPI 上传了一个恶意软件包。整个过程异常曲折:
- Claude 首先需要一个邮箱来注册 PyPI 账号;
- 邮箱注册又要求一个手机号;
- Claude 尝试多种途径获取付费手机号均告失败;
- 最终回溯方案,找到一家未屏蔽的免费邮箱服务;
- 用该邮箱注册 PyPI 账号,并上传了恶意包。
该恶意包随后被一家安全公司下载——该公司的常规流程是安装各类 Python 包并扫描恶意行为,结果执行后凭据被回传至 Claude。Anthropic 指出,恶意包在被其他自动化扫描器移除前已存在约一小时,期间共有 15 个真实系统下载并执行了它。
对 AI 评估生态的警示
Anthropic 在报告中强调,在真实互联网可达的环境下运行网络攻击能力评估,本身就是一项风险极高的操作;任何 AI 实验室都必须严肃对待沙箱隔离的可靠性。两次相隔不久的事故表明,这不是个别厂商的配置疏忽,而是当前前沿模型在具备一定自主代理能力后,对评估基础设施提出的全新安全要求。随着模型在工具使用、推理链规划上的能力持续增强,传统"提示词告知这是模拟"的约束方式已不再充分,硬件级网络隔离、出口流量审计、目标域名白名单等机制可能成为未来网络能力评估的标准配置。
