decoderesearch/SAELens

Training Sparse Autoencoders on Language Models

해결하는 문제

SAELens는 신경망의 내부 작동을 더 잘 이해하기 위해 스파스 오토인코더(SAE)를 표준화된 방식으로 훈련하고 분석할 수 있는 방법을 제공합니다. 이는 모델 활성화의 '블랙박스'를 더 해석 가능하게 만들어, 더 안전하고 일관성 있는 AI 시스템을 개발하는 데 도움이 됩니다.

작동 방식

이 라이브러리는 Hugging Face Transformers, NNsight, TransformerLens 등의 PyTorch 기반 모델에서 활성화를 추출하여 SAE의 인코딩 및 디코딩 메서드로 전달할 수 있게 해줍니다. 새로운 SAE를 훈련하거나 사전 훈련된 SAE를 로드하여 모델 활성화를 해석 가능한 특징으로 분해할 수 있는 도구를 제공합니다.

대상 사용자

기계적 해석성과 AI 안전성에 초점을 맞춘 AI 연구자들로, 특히 신경망 활성화를 스파스하고 이해하기 쉬운 구성 요소로 분해하고자 하는 연구자에게 적합합니다.

주요 기능

  • 사용자 정의 스파스 오토인코더를 생성하기 위한 자체 훈련 파이프라인.
  • 다양한 PyTorch 기반 모델과 프레임워크 지원.
  • 사전 훈련된 SAE 라이브러리에 대한 접근.
  • SAE-Vis와 같은 시각화 도구 및 SAEBench와 같은 평가 벤치마크와의 통합.

관련

  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트