TransformerLensOrg/TransformerLens
A library for mechanistic interpretability of GPT-style language models
해결하는 문제
TransformerLens은 훈련된 언어 모델이 가중치에서 학습한 알고리즘을 역공학하는 과정인 기계적 해석 가능성(mechanistic interpretability)을 위한 것입니다. 생성형 모델의 내부 활성화를 탐색할 수 있는 오픈소스 도구의 부족을 해결하여, 연구자들이 모델이 실제로 어떻게 내부에서 작동하는지 이해하기 쉽게 만듭니다.
작동 방식
이 라이브러리는 140개 이상의 아키텍처 패밀리(GPT-2 스타일 모델 및 Mamba/SSM 아키텍처의 실험적 지원 포함)에 걸쳐 15,000개 이상의 오픈소스 언어 모델을 로드할 수 있는 다리 역할을 합니다. 모델의 내부 활성화를 노출하여 사용자가 이러한 활성화를 캐시하거나, 훅 함수를 사용해 모델 실행 중 실시간으로 편집, 제거, 대체할 수 있도록 합니다.
대상 사용자
기계적 해석 가능성에 관심이 있는 AI 연구자 및 개발자들을 위한 것으로, 거대한 컴퓨팅 자원이나 산업 수준의 인프라 없이도 LLM의 내부 작동 방식을 탐구하고자 하는 사람에게 적합합니다.
주요 특징
- 광범위한 모델 지원:
TransformerBridge를 통해 수천 개의 모델을 다양한 아키텍처 패밀리에서 지원합니다. - 내부 활성화 접근 가능: 훅을 통해 내부 활성화를 캐시하고 조작할 수 있습니다.
- 아키텍처 다양성: 표준 Transformer 외에도 Mamba-1 및 Mamba-2와 같은 상태 공간 모델(SSM)에 대한 실험적 지원을 포함합니다.
- 연구용 최적화: 탐색적 연구 및 모델 가중치의 역공학을 촉진하도록 특별히 설계되었습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트