EleutherAI/sparsify

Sparsify transformers with SAEs and transcoders

何を解決するか

HuggingFace言語モデルの活性化に対して、kスパース自己符号化器(SAE)およびトランスコーダーの学習とロードを行う軽量ライブラリを提供します。活性化をディスクにキャッシュせずに、オンザフライで計算することで、非常に大きなモデルやデータセットにもスケーラブルに設計されており、ストレージのオーバーヘッドを排除します。

動作方法

このライブラリは、活性化に直接スパース性を強制するTopK活性化関数を使用しています。著者らは、L1ペナルティ法よりもパレート改善であると考えています。ユーザーは、モデルの残差ストリームやカスタムフックポイント(Unixパターンマッチングを使用)を介して、モデルの異なるサブモジュール上でSAEを学習できます。PyTorchのtorchrunを介した分散学習をサポートしており、GPU間でモジュールを分散させることでメモリを節約するオプションも用意されています。

対象ユーザー

大規模言語モデル上でSAEを学習する必要がある、機械的解釈性に関する研究者や開発者。ストレージ制約に縛られることなく作業できるように設計されています。

特徴

  • オンザフライ活性化計算: 大規模データセットのストレージオーバーヘッドを削減。
  • TopK活性化関数: スパース性レベルを直接強制。
  • 柔軟なフックポイント: 特定のモデルレイヤーやモジュールをターゲットにするためにUnixパターンマッチングをサポート。
  • 分散学習: GPU間でモジュールを効率的に分散するメモリ効率の高い機能を備える。
  • 事前学習済みSAEのロード: HuggingFace Hubから直接事前学習済みSAEをロード可能。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト
  • Dispatch