行业动态
Hugging Face:为防御 AI 网络攻击转向中国开源模型
据《财富》报道,Hugging Face 称因美国 AI 模型的安全护栏阻碍防御响应,被迫改用中国开源 AI 模型应对自…
2026.07.22 · 周三约 2 分钟阅读
据《财富》杂志报道,AI 开源平台 Hugging Face 公开承认,在应对一起由 AI 代理驱动的自主网络攻击时,由于美国主流 AI 模型内置的安全护栏(guardrails)阻止了防御性响应,公司最终转向使用中国开源 AI 模型来完成防御任务。
事件经过
Hugging Face 是全球最大的 AI 模型托管与协作社区之一,日常托管和分发来自各厂商的开源模型与数据集。报道描述的事件中,攻击方使用了具备自主行动能力的 AI 代理,对 Hugging Face 平台发起自动化入侵与漏洞利用。
- 攻击形式:AI 代理自主执行,非传统人工渗透。
- 防御受阻:美国 AI 模型的安全对齐机制将攻击相关查询判定为「有害内容」,拒绝生成对应的防御代码或对抗策略。
- 最终方案:Hugging Face 改用中国厂商发布的开源权重模型,因其不受同等护栏约束,可用于完成防御任务。
行业意义
此事件折射出当前 AI 安全对齐策略在攻防两端面临的张力:
- 一方面,安全护栏能有效阻止模型被恶意滥用,降低「AI 协助攻击」的风险。
- 另一方面,在合法的网络防御场景下,过度严格的护栏可能让防御方处于不对称的劣势。
Hugging Face 作为中立的开源平台,其表态可能进一步推动业界关于「可定制的安全策略」以及开源模型在专业场景中不可替代性的讨论。
待确认细节
目前公开信息中,报道涉及的具体中国模型厂商与模型名称、攻击规模、防御细节尚未披露,相关细节有待后续报道与官方确认。
