桃子桃子快讯
←返回首页
行业动态

Anthropic 将恢复对被拒请求收费以防御蒸馏攻击

Anthropic 宣布将重新对被拒请求计费,以防范蒸馏攻击,涉及生物学、蒸馏攻击与 LLM 开发相关请求。

2026.09.25 · 周五约 2 分钟阅读

Anthropic 近日宣布将恢复对被拒绝请求(rejected requests)进行计费的策略,以应对针对其模型的蒸馏攻击(distillation attacks)。据 TestingCatalog 在 X 上披露的信息,此次计费恢复主要覆盖与生物学、蒸馏攻击以及 LLM 开发相关的请求类别。

政策调整背景

Anthropic 此举的核心目的是遏制恶意方通过构造特定查询、利用模型输出的中间信号或拒绝模式来「蒸馏」其模型能力的行为。所谓蒸馏攻击,是指攻击者通过大量请求获取目标模型的输出特征,进而训练出能力相近的替代模型,这一手段近年来已成为前沿大模型面临的主要安全威胁之一。

影响范围

根据现有信息,新的计费策略将适用于以下几类请求:

  • 与生物学相关的高风险查询
  • 涉及蒸馏攻击模式的请求
  • 其他与 LLM 开发直接相关的请求

Anthropic 此举意味着开发者即便收到拒绝响应,仍需为相关请求支付费用。这一变化预计将增加从事对抗性研究或安全测试的团队成本,同时也可能促使 API 调用方更加谨慎地设计查询,以减少无效请求。

安全与商业考量

对被拒请求恢复收费,是 Anthropic 在安全防护与商业可持续性之间的一次权衡。此前 Anthropic 曾对被拒请求免于收费,以降低开发者测试与迭代的成本;但在蒸馏攻击频发的背景下,免费策略反而被攻击者利用。通过恢复计费,Anthropic 试图提高恶意行为的边际成本,从而遏制大规模模型蒸馏行为。

截至目前,Anthropic 尚未公布完整的政策文档细则,具体费率、判定标准及生效时间仍需以官方公告为准。

信源