Anthropic과 AE Studio, 이중 용도 지식 제어를 위한 GRAM 도입

Anthropic은 AE Studio와 협력하여, 유익한 목적과 해로운 목적 모두에 사용될 수 있는 정보인 이중 용도 지식(dual-use knowledge)을 모델의 가중치 내에서 제거 가능한 구획으로 격리하는 기술인 Gradient-Routed Auxiliary Modules (GRAM)를 도입했습니다. 이 접근 방식은 개발자가 여러 개의 별도로 필터링된 모델을 학습시키는 막대한 비용 없이도 특정 위험한 능력을 정밀하게 제거하거나 신뢰할 수 있는 사용자에게 액세스 권한을 부여할 수 있도록 합니다.

이중 용도 지식의 과제

프런티어 AI 모델은 방대한 지식의 저장소 역할을 하지만, 바이러스학이나 사이버 보안과 같은 특정 영역은 백신을 만들거나 병원체를 설계할 수 있고, 취약점을 패치하거나 악용할 수 있기 때문에 "이중 용도"로 간주됩니다. 현재의 안전 장치는 주로 입력과 출력을 스크리닝하는 거부 학습(refusal training)과 분류기(classifiers)에 의존합니다. 그러나 이러한 방법은 모델로부터 근본적인 지식을 제거하지 않으므로 탈옥(jailbreaks)에 취약할 수 있습니다.

사전 학습 데이터 필터링은 이 지식을 제거할 수 있지만, 이는 서로 다른 능력 세트를 위해 완전히 별개의 모델을 학습시켜야 하는 투박한 도구입니다. 대규모 프런티어 모델의 경우, 다양한 배포 요구 사항에 맞춰 모델의 여러 버전을 학습시키는 계산 비용이 매우 높습니다.

GRAM의 작동 방식: Gradient-Routed Auxiliary Modules

GRAM은 특정 범주의 지식을 전용의 제거 가능한 모듈로 격리함으로써 데이터 필터링의 이점을 제공합니다.

아키텍처 구현

GRAM은 표준 Transformer 아키텍처의 모든 레이어에 추가적인 뉴런을 추가합니다. 이러한 뉴런들은 "모듈"로 구성되며, 각 이중 용도 범주당 하나의 모듈이 할당됩니다.

학습 과정

학습 중에 모델은 다음과 같은 로직을 사용합니다:

  • 일반 목적 텍스트: 모델은 표준 학습 절차를 사용하여 학습합니다.
  • 이중 용도 텍스트: 모델이 특정 이중 용도 범주(예: 바이러스학)의 텍스트를 접할 때, 일반 지식을 사용하여 예측을 수행할 수 있지만, 해당 바이러스학 모듈 내의 가중치만 해당 데이터로부터 학습하는 것이 허용됩니다. 일반 목적 가중치는 일시적으로 동결됩니다.

이 메커니즘즘은 이중 용도 지식이 전체 네트워크로 확산되지 않고 특정 모듈에 축적되도록 보라는합니다. 결과적으로, 해당 모듈을 삭제하여 능력을 완전히 제거하거나 신뢰할 수 있는 배포를 위해 유지할 수 있습니다.

실험 결과 및 테스트

연구원들은 능력을 제거하고 일반 성능을 유지하는 데 있어 GRAM의 효과를 평가하기 위해 세 가지 설정에서 GRAM을 테스트했습니다.

합성 및 실제 데이터셋

합성된 어린이용 동화책을 사용한 테스트에서, GRAM 모델은 해당 주제를 필터링하여 처음부터 학습시킨 모델과 거의 동일한 성능을 보이는 방식으로 주제를 "잊게" 재구성할 수 있었습니다. 웹 텍스트, 코드, 과학 논문이 혼합된 더 큰 테스트에서는 모델이 바이러스학, 사이버 보안, 핵물리학, 그리고 틈새 프로그래밍 언어의 네 가지 도메인으로 라우팅되었습니다. 이러한 모듈을 삭제하면 데이터 필터링만큼 효과적으로 능력을 제거할 수 있습니다.

복구 저항성

GRAM은 "언러닝(unlearning)" 기술보다 더 강력한 것으로 입증되었습니다. 언러닝은 지식을 억제할 뿐이어서 파인튜닝을 통해 쉽게 복원될 수 있는 반면, GRAM은 공격자가 소량의 악성 데이터를 사용하여 제거된 지식을 복구하려는 시도를 저항항합니다. 데이터 필터링과 유사한 성능을을 보여줍니다.

확장성 및 성능

5,000만 개에서 50억 개의 파라미터에 이르는 7가지 모델 크기에서 수행된 실험은 다음과 같은 결과를 보여줍니다:

  • GRAM은 모든 크기에서 데이터 필터링의 성능과 일치했습니다.
  • "모듈 온(on)"과 "모듈 오프(off)" 구성 간의 격차는 모델이 확장될수록 더 커졌습니다.
  • 모델 크기가 증가함에 따라 보호 기능을 우회회하는 것이 상대적으로 더 어렵고 비싸게 됩니다.

한계점 및 향후 전망

GRAM is currently early-stage research and has not been applied to production models, including the Claude family. GRAM은 현재 초기 단계 연구이며, Claude family를 포함한 프로덕션 모델에 적용되지 않았습니다. 연구원들은 몇 가지 주요 한계점을 확인했습니다:

  • 평가 지표표: 현재의 평가는가 실세계의 다운스트림 태스크에 대한 성능이 아닌 다음 토큰 예측 능력을 다음 토큰 예측 능력을 측정합니다.
  • 지식 얽힘: 일부 이중 용도 능력은 일반 지식과 너무 깊게 얽혀 있어 이 방법으로 깔끔하게 분리리할 수 없습니다.
  • 프로덕션 규모: 이 방법은 아직 프로덕션 학습 파이프라인이나 프런티어 규모에서 테스트되지 않았습니다.

Sources

관련