行业动态
Anthropic 将恢复对被拒请求收费以防御蒸馏攻击
Anthropic 宣布将重新对被拒请求计费,以防范蒸馏攻击,涉及生物学、蒸馏攻击与 LLM 开发相关请求。
2026.09.25 · 周五约 2 分钟阅读
Anthropic 近日宣布将恢复对被拒绝请求(rejected requests)进行计费的策略,以应对针对其模型的蒸馏攻击(distillation attacks)。据 TestingCatalog 在 X 上披露的信息,此次计费恢复主要覆盖与生物学、蒸馏攻击以及 LLM 开发相关的请求类别。
政策调整背景
Anthropic 此举的核心目的是遏制恶意方通过构造特定查询、利用模型输出的中间信号或拒绝模式来「蒸馏」其模型能力的行为。所谓蒸馏攻击,是指攻击者通过大量请求获取目标模型的输出特征,进而训练出能力相近的替代模型,这一手段近年来已成为前沿大模型面临的主要安全威胁之一。
影响范围
根据现有信息,新的计费策略将适用于以下几类请求:
- 与生物学相关的高风险查询
- 涉及蒸馏攻击模式的请求
- 其他与 LLM 开发直接相关的请求
Anthropic 此举意味着开发者即便收到拒绝响应,仍需为相关请求支付费用。这一变化预计将增加从事对抗性研究或安全测试的团队成本,同时也可能促使 API 调用方更加谨慎地设计查询,以减少无效请求。
安全与商业考量
对被拒请求恢复收费,是 Anthropic 在安全防护与商业可持续性之间的一次权衡。此前 Anthropic 曾对被拒请求免于收费,以降低开发者测试与迭代的成本;但在蒸馏攻击频发的背景下,免费策略反而被攻击者利用。通过恢复计费,Anthropic 试图提高恶意行为的边际成本,从而遏制大规模模型蒸馏行为。
截至目前,Anthropic 尚未公布完整的政策文档细则,具体费率、判定标准及生效时间仍需以官方公告为准。
