Anthropic 联合 AE Studio 提出 GRAM:为大模型双重用途知识加可移除开关
Anthropic 与 AE Studio 提出 GRAM 方法,可在单个模型中为双重用途知识设置可删除的模块,从而灵活…
AI 顶级模型既包含大量通用知识,也存储了可被善意或恶意利用的双重用途(dual-use)信息,例如网络安全攻防、病毒学等。Anthropic 与 AE Studio 联合发表的新研究提出了一种名为 GRAM(Gradient-Routed Auxiliary Modules,梯度路由辅助模块)的方法,目标是在只训练一个模型的前提下,灵活开启或关闭各类双重用途能力,同时不损害模型的通用表现。这是 Anthropic 一手披露的早期研究成果,尚未应用于任何生产模型。
研究动机:现有防护为何不够
当前对模型危险输出的防护主要依赖两类手段:训练模型拒绝有害请求,以及用分类器在输入输出端做内容审查。这些方法属于「输出层」防御,并不会改变模型权重中已存储的知识。一位足够执着的攻击者仍可能通过越狱手段绕过防线,诱导模型释放其内部的双重用途能力。
更稳健的思路是直接管控模型「知道什么」。此前已有研究在预训练数据中过滤掉化学、生物、放射与核武相关知识,或将双重用途知识限制在模型权重的一片可移除区域。但这些方法都比较粗放:要为不同部署场景(例如受信的生物安全实验室 vs. 公开服务)准备不同能力的版本,往往需要分别训练多个模型,成本难以承受,尤其对体量巨大的前沿模型而言更是如此。
GRAM 的核心思路
GRAM 的核心是为每类双重用途知识在模型中开辟独立的、可移除的「模块」,并让模型在学习该类数据时只更新对应模块。
具体做法上,GRAM 在标准 Transformer 的每一层额外加入若干神经元,并将这些神经元按双重用途类别划分为若干「模块」。训练通用文本时,模型按常规方式学习;当遇到某一双重用途类别(例如病毒学)的文本时,通用权重会被临时冻结,只有对应的病毒学模块允许更新,从而让该类知识集中沉淀在该模块内,而非扩散到整个网络。
训练结束后,模块可被直接删除,相应能力随之消失;也可保留模块,以便在受信场景中按需启用。实验中定义了四个双重用途类别,因此单次训练即可得到一个能按 2⁴=16 种组合配置能力的模型。
三轮实验验证
研究团队在由浅入深的三种设定下对 GRAM 进行了测试:
- 合成数据阶段:使用按主题标注的儿童故事数据集,小型 GRAM 模型可以「遗忘」任意指定主题,且每种配置的表现接近于用过滤后的数据从头训练一个独立模型,即用一次训练的成本获得了多次训练的效果。
- 真实数据阶段:在网页文本、代码与学术论文的混合数据上训练较大模型,覆盖病毒学、网络安全、核物理以及一种小众编程语言(作为专业双重用途代码的代理)。结果显示:删除对应模块几乎等同于从未训练过该数据;通用任务性能未出现明显退化;攻击者用少量恶意数据尝试恢复被删能力的难度,与数据过滤方法相当。相比之下,训练后施加的「反学习」技术只是压制知识,少量微调即可恢复。
- 模型规模阶段:在 5000 万到 50 亿参数共 7 个规模上重复实验,GRAM 在各规模下都与数据过滤持平;而且随模型增大,模块「开/关」之间的能力差距进一步拉大,绕过保护的计算成本也相对上升。
局限与展望
研究也坦承存在明确局限:这是早期工作,GRAM 尚未用于任何生产模型,团队也不确定未来是否会落地。文章原文在「我们还没有……」处被截断,完整限制条件未在公开摘录中给出。但其方向意义在于:随着模型能力提升,仅靠分类器与拒绝训练越来越难兼顾安全与可用性,而 GRAM 这类方法提供了一条更稳健、更细粒度的访问控制路径,为前沿模型的安全部署提供了新的工程选项。
