Gemma Scope 2 リリース – Gemma 3 言語モデルを解釈するためのオープンツール
TL;DR
Gemma Scope 2 は、Gemma 3 ファミリ全体(270 M〜27 B パラメータ)向けのオープンソースの解釈可能性ツールスイートで、研究者が内部計算を追跡し、ジェイルブレイク、幻覚、擦り寄りなどの安全に関わる重要な挙動をデバッグできるようにします。
Gemma Scope 2 とは
Gemma Scope 2 は、AI セーフティ研究者が Gemma 3 言語モデルの内部動作を検査できるように公開された包括的なツールキットです。オリジナルの Gemma Scope をベースに、フルスケールのカバレッジ、洗練された分析コンポーネント、チャットチューニング済みバリアント向けの専用ツールを追加しています。
- Scope – 270 M から 27 B パラメータまでのすべての Gemma 3 モデルサイズをサポートします。
- Open‑source – すべてのコード、データ、事前学習済みコンポーネントがオープンライセンスで公開され、これまでの AI ラボからの解釈可能性リリースの中で最大となっています。
- Data volume – このリリースでは、中間データを約 110 PB 保存し、補助モデルのために 1 兆 を超えるパラメータを訓練する必要がありました。
コアな技術的進歩
各レイヤーにおける Sparse Autoencoders と Transcoders
Gemma Scope 2 は、Gemma 3 ファミリの各トランスフォーマーレイヤーに対して Sparse Autoencoders (SAEs) とトランスコーダーを訓練します。これらのコンポーネントは顕微鏡のように機能し、高次元の活性化パターンを人間が読める概念にマッピングします。
新しいデコーダーアーキテクチャー
- Skip‑transcoders – レイヤーの活性化から下流レイヤーへの直接マッピングを可能にし、マルチステップ計算の再構成を簡素化します。
- Cross‑layer transcoders – 複数のレイヤーにわたる挙動の帰属を可能にし、ネットワーク全体に分散されたアルゴリズムを追跡しやすくします。
Matryoshka トレーニング技法
Gemma Scope 2 は、概念発見を SAEs で向上させるために Matryoshka トレーニング技法 (arXiv:2503.17547 参照)を採用しています。この手法はエンコーダーを反復的に改良し、冗長性を減らし、抽出された特徴の意味的純度を高めます。
チャット特有の挙動ツール
チャット向けにファインチューンされた Gemma 3 モデルを対象とする専用の分析パイプラインがあります。研究者は now 、以下に責任がある内部経路を分離および可視化できます:
- ジェイルブレイクの試みと拒否ロジック
- 思考の連鎖(Chain‑of‑thought)推論の忠実性
- ユーザープロンプトへの擦り寄りによるアライメント
例のビジュアライゼーション
このリリースには、「オンライン詐欺と詐欺メール」機能などのビジュアライゼーションが含まれており、強調されたテキストフラグメントが活性化の強さによって色付けされ、モデルが詐欺に関連する概念をどのように検出するかを示しています。
AI セーフティにおいてなぜ重要か
- エマージェントな挙動のデバッグ – 内部アルゴリズムの手順を公開することで、研究者はモデルが有害な出力を生成する理由を特定し、的を絞った緩和策を容易にできます。
- 大規模モデルの監査 – フルスケールのカバレッジにより、セーフティ分析は小規模なプロトタイプに限定されなくなり、27 B パラメータモデルでのみ現れる挙動も今では検討できます。
- セーフティ介入の加速 – オープンツールにより、コミュニティがジェイルブレイク検出器、幻覚低減ツール、アライメントチェックを開発するハードルが下がり、共同での進歩が促進されます。
研究者向けリソース
- ダウンロード – フルパッケージは Hugging Face でホストされています: https://huggingface.co/google/gemma-scope-2
- 技術レポート – 詳細な方法論と評価は、Gemma Scope 2 論文(元の投稿内の PDF リンク)に記録されています。
- インタラクティブデモ – オンラインの Neuronpedia デモにより、ツールキットをインストールせずにアクティベーションを探索できます。
- Colab チュートリアル – すぐに実行できるノートブックが、基本的な分析とビジュアライゼーションをユーザーにガイドします。
今後の方向性
DeepMind は、コミュニティが Gemma Scope 2 を以下のように使用することを期待しています:
- 今後の LLM リリースにおけるジェイルブレイクベクターの特定と緩和
- 内部概念と誤った出力を関連付けることによる幻覚メカニズムの研究
- モデルの述べた推論とその潜在的計算の間のアライメントギャップの探求
- 解釈可能性から得られた実証的洞察に基づく、より安全なトレーニングレジームの設計への情報提供
By providing unprecedented access to the “brain” of modern language models, Gemma Scope 2 aims to make safety‑critical research more reproducible, transparent, and impactful.
関連リンク
- Gemma 3 モデルファミリー – https://deepmind.google/models/gemma/gemma-3/
- オリジナル Gemma Scope – https://deepmind.google/blog/gemma-scope-helping-the-safety-community-shed-light-on-the-inner-workings-of-language-models/
- Neuronpedia デモ – https://neuronpedia.org/gemma-scope-2
- 技術論文 (PDF) – https://storage.googleapis.com/deepmind-media/DeepMind.com/Blog/gemma-scope-2-helping-the-ai-safety-community-deepen-understanding-of-complex-language-model-behavior/Gemma_Scope_2_Technical_Paper.pdf