Anthropic 언어 모델을 이해 가능한 구성 요소로 분해하기

Anthropic은 언어 모델을 '특징(features)'이라고 불리는 해석 가능한 구성 요소로 분해하는 방법을 도입하여, 신경망이 정보를 처리하는 방식에 대한 더 깊은 이해를 가능하게 했습니다. 이 접근 방식은 개별 뉴런이 모델 동작과 일관된 관계를 갖지 못하는 경우가 많다는 점에 착안하여, 개별 뉴런에 의존하는 대신 특정하고 일관된 개념에 해당하는 뉴런 활성화의 선형 결합을 식별함으로써 AI의 "black box" 특성을 해결합니다.

개별 뉴런을 넘어 특징으로 이동하기

신경망의 개별 뉴런은 종종 다의성(polysemantic)을 띱니다. 즉, 하나의 뉴런이 여러 관련 없는 문맥에서 활성화될 수 있음을 의미합니다. 예를 들어, 소규모 언어 모델의 단일 뉴런은 학술 인용, 영어 대화, HTTP 요청, 한국어 텍스트에 대해 동시에 활성화될 수 있습니다. 개별 뉴런은 네트워크 동작과 일관된 관계를 없기 때문에, 실패 모드를 진단하거나 모델의 안전성을 인증하는 데 사용하기 어렵습니다.

이를 해결하기 위해 Anthropic 연구원들은 '특징(features)'을 주요 분석 단위로 식별했습니다. 특징은 뉴런 활성화의 패턴 또는 선형 결합입니다. 사전 학습(dictionary learning)을 사용하여 연구원들은 512개의 뉴런으로 구성된 레이어를 4,000개 이상의 특징으로 분해할 수 있었습니다. 이러한 특징들은 다음과 같은 뚜렷렷한 개념을 나타냅니다:

  • DNA sequences
  • Legal language
  • HTTP requests
  • Hebrew text
  • Nutrition statements

이러한 모델 속성의 대부분은 개별 뉴런의 활성화를 단독으로 분석할 때는 보이지 않습니다.

특징 해석 가능성의 검증

Anthropic은 두 가지 주요 방법을 사용하여 이러한 특징의 해석 가능성을 검증했습니다:

인간 평가

블라인드 테스트를 거친 인간 평가자들은 뉴런과 특징 모두의 해석 가능성을 점수화했습니다. 결과에 따르면 특징이 개별 뉴런보다 훨씬 높은 해석 가능성 점수를 받았습니다.

자동 해석 가능성(Autointerpretability)

연구원들은 대규모 언어 모델(LLM)을 사용하여 소규모 모델에 있는 특징들의 짧은 설명을 생성했습니다. 그런 다음, 다른 모델이 해당 설명만을 바탕으로 특징의 활성화를 예측할 수 있는지 여부를 기준으로 점수를 매겼습니다. 특징은 다시 한번 뉴런보다 높은 점수를 받았으며, 이는 특징 활성화와 그것이 모델 동작에 미치는 하위 효과가 일관된 해석을 제공함을 확인시켜 줍니다.

모델 스티어링 및 일반화

특징은 표적 모델 스티어링(model steering)을 위한 메커니즘을즘 제공합니다. 특정 특징을 인위적으로 활성화하면 모델의 동작이 예측 가능한 방식으로 변화하며, 이를 통해 연구원들은 내부 표현을 기반으로 모델 출력을 조작할 수 있습니다.

또한, 연구 결과에 따르면 이러한 학습된 특징들은 서로 다른 모델 간에 크게 보편적입니다. 이는 한 모델에서 특징을 연구함으로써 얻은 교훈이 다른 모델로 일반화될 수 있음을 시사합니다. 연구원들은 또한 학습된 특징의 수가 모델의 내부 관점을 해상도 조절하는 '노브(knob)' 역할을 할 수 있음을 발견했습니다. 적은 수의 특징은 거칠고 이해하기 쉬운 뷰를 제공하는 반면, 더 많은 특징은 더 미묘한 모델 속성을 드러냅니다.

AI 안전 및 스케일링에 대한 시사점

이 작업은 AI 안전에 대한 장기적인 연구 투자인 Mechanistic Interpretability의 일부입니다. 해석 불가능한 뉴런의 장애물을 극복함으로써, 이 방법은 모델 동작을 내부에서부터 모니터링하고 제어할 수 있는 경로를 제공하며, 이는 기업 및 사회적 도입에 필요한 신뢰성과 신뢰성을 위해 필수적입니다.

현재의 성공은 소규모 모델에서 입증되었습니다. 다음 주요 과제는 이 접근 방식을 훨씬 더 크고 복잡한한 frontier 모델에 스케일링하는 것입니다. Anthropic은 대규모 언어 모델을 해석하는 데 있어 주요 장애물은 이제 과학적 문제라기보다 엔지니어링 문제라고 밝히고 있습니다.

Sources

관련