Anthropic 和 AE Studio 推出用于双重用途知识控制的 GRAM

Anthropic 与 AE Studio 合作,推出了梯度路由辅助模块 (Gradient-Routed Auxiliary Modules, GRAM),这是一种旨在将双重用途知识(即既可用于有益目的也可用于有害目的的信息)隔离到模型权重中可移除的分隔区内的技术。这种方法允许开发人员手术式地移除特定的危险能力,或者在不承担训练多个独立过滤模型的昂贵成本的情况下,为受信任的用户授予访问权限。

双重用途知识的挑战

前沿 AI 模型充当着庞大的知识库,但某些领域,例如病毒学或网络安全,被认为是“双重用途”的,因为它们既可以用于制造疫苗,也可以用于设计病原体,或者既可以用于修补漏洞,也可以用于利用漏洞。目前的防护措施主要依赖于拒绝训练和分类器来筛选输入和输出。然而,这些方法并没有从模型中移除底层知识,使其容易受到越狱攻击。

虽然预训练数据过滤可以移除这些知识,但它是一种粗放的手段,需要为不同的能力集训练完全独立的模型。对于大规模前沿模型,为了适应不同的部署需求而训练多个模型版本的计算成本是极其高昂的。

GRAM 如何工作:梯度路由辅助模块

GRAM 通过将特定类别的知识隔离到专门的、可移除的模块中,实现了数据过滤的好处。

架构实现

GRAM 在标准 Transformer 架构的每一层都添加了额外的神经元。这些神经元被组织成“模块”,每个双重用途类别分配一个模块。

训练过程

在训练期间,模型使用以下逻辑处理数据:

  • 通用文本: 模型使用标准训练程序进行学习。
  • 双重用途文本: 当模型遇到来自特定双重用途类别(例如病毒学)的文本时,它可以使用其通用知识进行预测,但仅允许对应的病毒学模块内的权重进行学习。通用权重会被暂时冻结。

这种机制确保了双重用途知识会积累在特定的模块中,而不是扩散到整个网络中。因此,该模块可以被删除以完全移除该能力,或者保留用于受信任的部署。

实验结果与测试

研究人员在三种设置下测试了 GRAM,以评估其在移除能力和维持通用性能方面的有效性。

合成与现实数据集

在使用合成儿童故事进行测试时,一个 GRAM 模型可以被重新配置为“忘记”某些主题,其性能几乎与从头开始训练并过滤掉这些主题的模型完全相同。在更大规模的测试中,使用了网页文本、代码和科学论文的混合物,模型被路由到四个领域:病毒学、网络安全、核物理学和一种小众编程语言。删除这些模块与数据过滤的效果一样有效。

抗恢复性

GRAM 被证明比“遗忘”技术更具鲁棒性。虽然“遗忘”技术仅抑制知识,使其很容易通过微调来恢复,但 GRAM 能抵御攻击者试图使用少量恶意数据来恢复已移除知识的尝试,其表现与数据过滤相似。

可扩展性与性能

在 5000 万到 50 亿参数的七种模型规模下进行的实验表明:

  • GRAM 在每种规模下都达到了与数据过滤相当的性能。
  • “模块开启”与“模块关闭”配置之间的差距随着模型规模的扩大而变得越来越大。
  • 随着模型规模的增加,绕过保护措施变得相对更加困难且昂贵。

局限性与未来展望

GRAM 目前处于早期研究阶段,尚未应用于生产模型,包括 Claude 系列。研究人员指出了几个关键的局限性:

  • 评估指标: 当前的评估衡量的是下一个 token 的预测能力,而不是在现实世界下游任务中的表现。
  • 知识纠缠: 一些双重用途能力可能与通用知识深度纠缠,以至于无法使用这种方法进行干净的切分。
  • 生产规模: 该方法尚未在生产训练流水线或前沿规模下进行过测试。

Sources

相关