decoderesearch/SAELens

Training Sparse Autoencoders on Language Models

何を解決するか

SAELens は、ニューラルネットワークの内部動作をよりよく理解するために、スパース自己符号化器(SAE)を標準化された方法で訓練・分析するためのツールです。これにより、モデルの活性化の「ブラックボックス」をより解釈可能にすることで、より安全で整合性の高いAIシステムの構築を支援します。

動作方法

このライブラリは、Hugging Face Transformers、NNsight、TransformerLens などの PyTorch ベースのモデルから活性化を抽出し、SAE の符号化・復号メソッドに渡すことを可能にします。新しい SAE の訓練や、事前に訓練された SAE の読み込みをサポートしており、モデルの活性化を解釈可能な特徴に分解できます。

対象ユーザー

機械的解釈性とAI安全性に注力するAI研究者。特に、ニューラルネットワークの活性化をスパースで理解しやすい構成要素に分解したい研究者に適しています。

特徴

  • カスタムスパース自己符号化器を作成するための独自の訓練パイプライン。
  • 広範な PyTorch ベースのモデルおよびフレームワークのサポート。
  • 事前に訓練された SAE のライブラリへのアクセス。
  • SAE-Vis などの可視化ツールや、SAEBench などの評価ベンチマークとの統合。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト