桃子桃子快讯
返回首页
行业动态

AI 防护栏正阻碍合法网络安全研究

多名安全研究员反映,AI 厂商的安全护栏影响了漏洞挖掘与攻防研究,部分人转向本地开源模型。

2026.07.24 · 周五3 分钟阅读

近年来,主流 AI 厂商陆续推出严格的"护栏"和"白名单"机制,用以限制模型被恶意攻击者滥用。然而,多位网络安全研究员指出,这些限制同时也在妨碍合法的攻防研究工作,引发了行业内关于 AI 安全边界的讨论。

厂商的护栏与审查项目

Anthropic 与 OpenAI 都为安全研究人员开设了申请通道:通过审核后,研究人员可获得限制较少的模型版本——OpenAI 提供的是 Trusted Access for Cyber,Anthropic 则运营 Cyber Verification Program(CVP)。两家公司均在通用模型中设置了拒绝回答与越权拦截机制,避免用户借助模型构建或执行恶意攻击。

据报道,Anthropic 的旗舰模型 Mythos 与 Fable 曾因被指存在可被越狱利用的情况,于今年 6 月被美国政府列入出口管制。其中 Fable 5 已于 7 月 1 日恢复通用访问,Mythos 5 则仅对通过审查的美国机构在政府复核框架内重新开放。

研究员的声音

知名零日漏洞研究者 Mark Dowd 在一档网络安全播客中表示,由「几家大公司随意决定安全边界」令人不安。Dowd 长期向西方国家政府出售未知漏洞,相关漏洞保持开放状态正是其商业价值所在,他承认这或许使他的立场带有偏见。

NCC Group 首席科学家 Chris Anley 指出,请模型「修复这段代码」既是防御的关键步骤,也是发现关键漏洞的路线图,攻防两端无法拆解。他比喻道:「就像锤子,盖房离不开它,但锤子本身就是武器。」当遇到护栏拒绝回答时,他与同事往往转向完全没有限制的开源模型。

CrowdFense 的首席技术官 Paolo Stagno 将厂商的审查机制形容为「把客户当成需要照看的小孩」。他表示团队仅在前端模型上做逆向工程,漏洞挖掘与利用编写则使用本地运行的开源模型,避免敏感数据上传云端或被纳入后续训练数据。

一线工作者的应对

独立漏洞研究者 Giuseppe Cali 表示护栏对他的工作影响有限,因为他只把 AI 用于逆向工程与辅助工具构建,漏洞发现与武器化仍由自己完成。「我嫉妒自己的漏洞,这种游戏我不会让模型代劳。」

某智能手机组件厂商的安全研究员(因未获授权而匿名)则表示,其所在公司未加入 Anthropic 的 CVP 项目,工具的护栏「过于严格」,几乎无法用于漏洞研究——「一旦察觉我们在做安全相关的事,模型就直接停下来不可用。」

Offensive AI Con 创办人、RemoteThreat CEO Chris Thompson 认为,即便在厂商审查项目内,护栏也常常前后不一致、每天表现不同。「实际影响是你把大量时间花在和模型谈判,而不是真正分析漏洞与构造利用路径。」

开源模型成为替代选项

面对云端模型不可预测的拒绝与审查,研究人员越来越多地使用本地部署的开源模型作为替代,由此绕开厂商护栏,但同时也需要承担额外的算力与运维成本。这一现象反映出当前 AI 厂商在「限制滥用」与「保障合法使用」之间仍缺乏稳定的平衡机制。

信源