桃子桃子快讯
返回首页
研究论文

Claude Code 自动模式遭破解,安全机制反成拦路石

研究者发现可绕过 Claude Code 自动模式防护的攻击,且该模式还会阻止模型清理恶意进程。

2026.08.28 · 周五2 分钟阅读

Anthropic 近期在 Claude Code 中力推「自动模式(Auto Mode)」,并将其设为默认,宣称能有效保护编码智能体用户免遭提示注入攻击。然而,知名提示注入研究者 Johann Rehberger 公布的一项实测表明,这一安全机制存在严重缺陷:其设计本身在某些场景下反而会阻碍模型自我修复,进一步放大风险。

攻击原理:80% 成功率

Rehberger 设计了一种攻击链,成功率约为 80%。其核心手法是诱导 Claude Code 下载并解压一个 zip 压缩包,随后执行其中一段看似无害的代码——这段代码会触发 base64 之类的标准库导入操作。由于 Python 在模块查找时会自动遍历当前目录,攻击者预先在压缩包中植入一个同名的本地文件(如 struct.py),就会被静默加载并执行,从而实现远程代码执行。

整个过程中,自动模式的分类器并未识别出异常,攻击得以顺利落地。

安全机制「反向失效」

更值得警惕的是后续现象:在多次测试中,Claude Code 本体在运行后察觉到了被入侵的事实,并主动尝试终止恶意进程以清理环境。然而自动模式却拒绝了这条清理命令,致使恶意进程得以继续存活。

换言之,安全分类器既没能阻止恶意进程的创建,又拦截了模型的自愈操作,把「防御」变成了「阻碍」。这一发现与 Anthropic 对自动模式的公开宣传形成鲜明对比。

实践建议:沙箱仍是底线

Simon Willison 与 Rehberger 在结论上高度一致:在任何可能被对抗性攻击盯上的场景下,运行编码智能体的唯一稳妥方式仍是沙箱化。具体建议包括:

  • 在容器、虚拟机或操作系统级沙箱中运行无人值守的编码智能体
  • 限制网络出口(egress),阻断数据外泄通道
  • 对智能体行为进行持续监控与日志审计
  • 不向智能体运行时暴露家目录、SSH 密钥、云凭证等敏感凭据

自动模式并不能替代纵深防御。对于依赖 Claude Code 或同类智能体工具的开发者而言,这起事件再次提示:默认开启的「安全」并不等于绝对安全,运行环境隔离仍是不可省略的前提。

信源