Anthropic, LLM 해석 가능성을 위한 회로 추적 도구 오픈 소스 공개
Anthropic은 어트리뷰션 그래프(attribution graphs) 생성을 통해 대규모 언어 모델(LLM)의 "생각"을 추적하는 새로운 방법론과 관련 라이브러리를 오픈 소스로 공개했습니다. 이번 출시는 모델 회로를 시각화하고 분석할 수 있는 도구를 커뮤니티에 제공함으로써, AI 능력의 발전과 AI 내부 작동 방식에 대한 이해 사이의 간극을 메우는 것을 목표로 합니다.
모델 해석 가능성을 위한 어트리뷰션 그래프
Anthropic의 회로 추적 방식은 어트리뷰션 그래프를 활용하여 모델이 특정 출력에 도달하기 위해 거치는 내부 단계를 부분적으로 드러냅니다. 이러한 내부 경로를 매핑함으로써, 연구자들은 모델을 블랙박스로 취급하는 것을 넘어 특정 행동을 담당하는 구체적인 회로를 식별할 수 있습니다.
도구 및 생태계
이번 출시는 서로 다른 기술적 참여 수준을 위해 설계된 두 가지 주요 구성 요소로 이루어져 있습니다:
- Circuit-Tracer Library: GitHub에서 사용할 수 있는 오픈 소스 코드 저장소로, 인기 있는 오픈 웨이트 모델에 대한 어트리뷰션 그래프 생성을 지원합니다. 이 라이브러리는 정교한 연구 및 프로그래밍 방식의 사용을 목적으로 합니다.
- Neuronpedia Frontend: Neuronpedia에서 호스팅하는 대화형 프론트엔드로, 사용자가 기본 코드를 관리할 필요 없이 직접 선택한 프롬프트에 대한 어트리뷰션 그래프를 생성하고 탐색할 수 있게 해줍니다.
연구 역량 및 응용 분야
오픈 소스 도구들을 통해 연구자들은 세 가지 주요 기능을 수행할 수 있습니다:
- Circuit Tracing: 지원되는 모델에서 어트리뷰션 그래프를 생성하여 내부 경로를 식별합니다.
- Visualization and Collaboration: 대화형 프론트엔드를 사용하여 결과 그래프를 시각화하고, 주석을 달고, 공유합니다.
- Hypothesis Testing: 피처(feature) 값을 수정하여 이러한 변화가 모델 출력에 직접적으로 어떤 영향을 미치는지 관찰함으로써, 해석 가능성 가설을 실증적으로 테스트할 수 있습니다.
Anthropic은 이미 Gemma-2-2b 및 Llama-3.2-1b와 같은 모델에서 다단계 추론 및 다국어 표현을 연구하기 위해 이 도구들을 적용했습니다. 특히 Gemma 그래프는 Google GemmaScope 프로젝트의 일환으로 훈련된 transcoders를 활용합니다.
개발 및 협업
이 프로젝트는 Anthropic Fellows 프로그램 참가자(Michael Hanna 및 Mateusz Piotrowski)가 주도하였으며, Emmanuel Ameisen과 Jack Lindsey의 멘토링을 받았습니다. Neuronpedia와의 통합은 Johnny Lin과 Curt Tigges가 이끄는 Decode Research에서 구현했습니다.
Sources
관련
- Dispatch
- 프로젝트
- Dispatch
- Dispatch
- Dispatch