研究:21款主流开源大模型安全防护均可被剥离
Waterloo 与 FAR.AI 团队测试 21 款主流开源大模型,发现安全防护均可被剥离,并发布 TamperBen…
由加拿大滑铁卢大学(University of Waterloo)与 AI 安全研究机构 FAR.AI 联合领导的国际研究团队发现,全球最广泛使用的 21 款开源权重大语言模型(LLM)的内置安全防护,均可在微调或篡改过程中被轻易剥离。这项研究在 ACM 知识发现与数据挖掘会议(KDD)上正式发表,并同步推出了开源测试工具 TamperBench,旨在推动学界对开源模型安全性的系统化评估。
研究背景与核心发现
研究团队对当前最流行的 21 款开源权重大语言模型进行了严格的安全测试,涵盖微调攻击、参数篡改等多种常见手法。结果显示,即便是目前防护做得最好的模型,也未能经受住系统化的攻击测试,安全护栏可以被剥离。
研究负责人、滑铁卢大学管理科学与工程系教授 Sirisha Rambhatla 博士表示:「当一个能力较强模型的安全护栏被剥离后,它可以被大规模地用于有害目的,这种伤害是一个人手工作业永远无法达到的。」她同时强调,开源权重模型对 AI 研究的透明性与问责机制仍然不可或缺。
TamperBench:开源安全测试工具
为系统化衡量不同攻击方式对模型安全防护的影响,研究团队构建并开源了一款名为 TamperBench 的标准化测试工具。该工具能够模拟多种针对开源模型的篡改场景,希望吸引更多研究者共同完善测试方法与防御机制。
- 测试覆盖 21 款主流开源权重模型
- 模拟场景包括微调攻击、参数篡改等
- 已开源,供学界复用与扩展
研究团队成员、实验室研究员 Saad Hossain 指出:「目前可用的防御措施还不够强,无法保证公开发布的模型在落入任何修改者手中后仍然安全。随着各国政府越来越多地在医疗、欺诈检测、教育等公共服务中依赖 AI,模型的评估与采购必须更加严格、有据可依。」
潜在风险与影响
研究团队警告,开源权重模型一旦被剥离安全护栏,可能被用于以下场景:
- 大规模虚假信息传播
- 高度逼真的邮件钓鱼诈骗
- 危险化学品的分步制作指南
值得注意的是,Rambhatla 也强调,这些安全弱点可能并非开源模型独有,闭源模型同样面临类似风险。但鉴于开源模型可被任意下载与微调,其被滥用的门槛更低、规模更大,因此风险尤为突出。
研究团队与发表
该研究由来自加拿大、美国和瑞士的成员共同完成,合作机构包括滑铁卢大学关键机器学习实验室(Critical Machine Learning Lab)、麻省理工学院(MIT)、苏黎世联邦理工学院(ETH Zurich)以及多伦多大学。相关论文《TamperBench: Systematically Stress-Testing LLM Safety Under Fine-Tuning and Tampering》已在韩国举办的 ACM KDD 会议上正式发表。
