模型发布
Anthropic:新版 Claude Opus 模型提示注入抗性显著提升
Anthropic 工程师 Boris Cherny 透露,最新 Claude Opus 模型是迄今「最难被提示注入」的…
2026.07.25 · 周六约 2 分钟阅读
Anthropic 工程师 Boris Cherny 近日在公开场合表示,最新一代 Claude Opus 模型是 Anthropic「迄今最难被提示注入」的版本。这一说法源自该模型的 System Card 第 73 页相关内容,原始引用由知名 AI 博主 Simon Willison 在其博客上整理发布。
来源与背景
Boris Cherny 是 Anthropic 的工程师,长期参与 Claude 相关产品的开发工作。他指出,相比各类基准评测分数,模型在提示注入防护上的进步更令人兴奋。该结论并非来自单一评测,而是综合了 PI(Prompt Injection)专项评估与红队测试(red teaming)的结果。
提示注入为何重要
提示注入(Prompt Injection)是指攻击者通过构造特殊输入,让大语言模型绕过系统指令、转而执行攻击者意图的行为。随着 LLM 被广泛集成到智能体、RAG 系统、自动化工作流中,这一风险已成为大模型落地的核心安全障碍之一。
- 若模型容易受到提示注入攻击,可能导致数据泄露、错误操作或越权行为。
- 在智能体场景下,被注入的指令可能让 AI 自动执行转账、删库、发送邮件等高风险操作。
- 因此,抗注入能力是衡量模型是否「可被放心部署」的关键指标。
Anthropic 的表述与限度
Boris Cherny 的原话强调,在 PI 评测和红队测试两个维度上,新版 Opus 都「非常难以成功注入」。需要注意的是:
- 此次披露仅为引用片段,并未给出具体的攻击成功率数值或对比基线。
- System Card 第 73 页的完整内容尚未在引用中展开,读者若需详细数据,仍需查阅原始系统卡。
- 「最难被注入」是相对表述,并不等同于「不可注入」,实际安全性仍取决于部署方式与配套防护。
小结
Anthropic 通过一线工程师的非正式渠道,释放了新一代 Claude Opus 模型在安全性上的关键信号。对于正在评估 LLM 落地安全性的开发者与企业而言,这一信息值得跟进——尤其需要关注其官方 System Card 的完整数据,以及后续独立第三方对该模型抗注入能力的实测结果。
