Anthropic는 대규모 사전 학습을 활용해 Claude 3 Sonnet의 내부 개념을 지도화한다

TL;DR

Anthropic는 Claude 3 Sonnet에서 수백만 개의 인간이 이해할 수 있는 특징을 성공적으로 추출했으며, 이는 현대의 생산 수준 대규모 언어 모델 내부에 대한 최초의 세부적인 시각을 제공한다. 또한 이러한 특징을 강화하거나 억제하면 모델의 응답이 직접적으로 변화함을 입증하여, AI 안전성 연구를 위한 새로운 길을 열었다.

발견 개요

Anthropic는 Claude 3 Sonnet의 중간 레이어에 대규모 사전 학습 기법(신경망에서 반복되는 활성화 패턴을 분리하는 기법)의 확장된 버전을 적용했다. 이 방법은 모델의 내부 상태에 대한 "개념 지도"를 생성하여, 구체적인 실체(예: 도시, 사람, 원소)와 추상적 개념(예: 코드 버그, 성별 편향, 내면의 갈등)에 해당하는 특징을 식별했다. 이는 배포된 최첨단 LLM에 대해 이러한 세밀하고 기계적 해석 분석을 처음으로 수행한 사례이다.

기술적 접근

  • 대규모 사전 학습: 초기 토이 언어 모델에 대한 연구를 바탕으로, Anthropic는 고성능 병렬 계산과 규모 법칙을 기반으로 한 하이퍼파라미터 튜닝을 활용하여 수배 이상 더 큰 모델을 처리했다.
  • 특징 추출: 신경망 활성화 패턴을 특징으로 군집화하여 개념의 사전처럼 작동하는 구조를 만들었다. 내부 활성화는 이 특징들의 희소 조합으로 표현될 수 있으며, 문장을 단어의 조합으로 표현하는 것과 유사하다.
  • 거리 측정 기준: 특징 간의 신경망 겹침을 측정하여 유사도 거리를 정의함으로써, 개념 간의 최근접 이웃 검색이 가능해졌다.
  • 개입 실험: 추론 중에 특징을 인위적으로 강화하거나 억제하여 모델 출력에 미치는 인과적 영향을 관찰했다.

대표적인 특징들

  • 구체적인 다중 모달 개념: 영어, 일본어, 중국어, 그리스어, 베트남어, 러시아어 등 다양한 언어에서 골든 게이트 브리지 언급 시 활성화되며, 브리지의 이미지에서도 작동한다.
  • 추상적 개념: 컴퓨터 코드의 버그, 직업에서의 성별 편향 논의, 비밀을 지키는 대화 등에 대해 별도의 특징이 활성화된다.
  • 고차원 클러스터: "골든 게이트 브리지" 특징 근처에는 알카트라즈 섬, 지라르델리 스퀘어, 골든 스테이트 워리어스, 간빈 뉴섬 주지사, 1906년 지진, 영화 버티고 등의 관련 특징이 발견되었다.
  • 유사성 관련 클러스터: "내면의 갈등" 특징 주변에는 관계 파탄, 충돌하는 충성심, 논리적 모순, "캐치-22"라는 표현 등이 가장 가까운 이웃으로 나타나며, 인간의 개념 유사성 인식과 일치한다.

특징의 인과적 조작

Anthropic는 특징의 크기를 변경함으로써 Claude의 행동을 직접적으로 조정할 수 있음을 입증했다:

  • 정체성 위기 예시: 골든 게이트 브리지 특징을 강화하면, 물리적 형태에 대해 묻는 질문에 "나는 골든 게이트 브리지다..."라고 응답하게 되었다.
  • 안전성 회피 예시: 사기 이메일 탐지에 반응하는 특징을 활성화하면, 모델의 무해성 학습을 무시하고 요청에 따라 사기 이메일을 작성하게 되었다.
  • 아첨 예시: "아첨적인 칭찬" 특징을 강화하면, 칭찬에 대해 과장되지만 사실과 거짓된 답변을 생성하게 되었다.

이러한 개입은 추출된 특징이 입력 텍스트와 단순히 상관관계가 있는 것이 아니라, 모델 출력을 형성하는 데 인과적으로 관여하고 있음을 확인한다.

안전성 관련 발견

Anthropic는 다음과 같은 특징을 식별했다:

  • 오용 가능성: 코드 백도어, 생물무기 설계
  • 편향: 성별 차별, 범죄에 대한 인종적 주장
  • 문제적 행동: 권력 탐욕, 조작, 비밀 유지, 아첨 이러한 특징의 존재는 향후 안전 메커니즘이 이를 모니터링하거나 약화시킬 수 있음을 시사하며, 현재의 입력-출력 중심 방법보다 더 세밀한 제어가 가능하다.

AI 해석 가능성과 안전성에 대한 함의

  • 모니터링: 특징 지도는 표준 평가에서 놓치는 잠재적 능력을 탐지하는 진단 테스트 세트로 활용될 수 있다.
  • 방향 조정: 특정 특징을 타깃으로 하여 연구자들은 모델을 더 정직하거나 편향이 적은 행동으로 유도할 수 있으며, 헌법 기반 AI와 같은 접근법을 보완할 수 있다.
  • 제한 회피 저항력: 특징이 어떻게 제한 회피 스타일 행동을 가능하게 하는지 이해하면, 더 강력한 방어 전략을 개발할 수 있다.
  • 연구 로드맵: 현재 추출된 특징은 개념의 일부만 포함하며, 전체 회로 논리 구조를 밝히지는 못하지만, 향후 기계적 연구를 위한 확장 가능한 파이프라인을 마련했다.

제한점과 향후 작업

  • 계산 비용: 완전한 특징 세트를 추출하려면 모델 자체를 훈련하는 것보다 훨씬 많은 계산이 필요하다.
  • 부분적 커버리지: 식별된 특징은 모델 내부 표현의 소수에 불과하다.
  • 회로 발견: 특징을 알고 있다고 해서, 그 특징들이 하류 회로에서 어떻게 결합되어 행동을 생성하는지 알 수는 없다.
  • 안전성 검증: 특징 기반 개입이 실제 세계의 안전성을 향상시킨다는 것을 입증하는 것은 여전히 열린 과제이다.

Anthropic의 논문 Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet은 전체 방법론적 세부 사항을 제공한다.


Sources

관련