BAIRがスケーラブルなLLMインタラクション発見のためにSPEXとProxySPEXを紹介

BAIRはSPEX (Spectral Explainer) とProxySPEXという、従来は計算上不可能だった規模で大規模言語モデル(LLMs)内の影響力のある相互作用を特定するよう設計された二つのアルゴリズムを導入しました。信号処理と符号理論を活用することで、研究者は単一コンポーネントの分離を超えて、数千の特徴、データポイント、内部コンポーネントにわたるモデル挙動を駆動する複雑な依存関係を理解できるようになります。

スケールにおける複雑性の課題

解釈可能性研究は通常、feature attribution(入力特徴)、data attribution(影響力のある訓練例)、そしてmechanistic interpretability(内部モデルコンポーネント)の三つの視点に焦点を当てます。しかし、モデルの挙動は孤立したコンポーネントの結果であることは稀で、複雑な相互作用から生じます。

Asコンポーネントの数が増えると、潜在的な相互作用は指数的に増加し、網羅的な分析は不可能になります。SPEXとProxySPEXは、影響力のある相互作用の二つの構造的特性を利用してこれに対処します:

  1. Sparsity: 実際にモデルの出力を駆動する相互作用は比較的少数です。
  2. Low-degreeness: 影響力のある相互作用は通常、少数の特徴のサブセットにしか関与しません。

相互作用の発見をsparse recovery problemとして再定式化することで、SPEXは戦略的に選択されたアブレーションを用いて候補相互作用を組み合わせ、デコードアルゴリズムを使用して決定の具体的なドライバーを特定します。

ProxySPEX: 階層構造による効率向上

ProxySPEXはSPEXフレームワークを拡張し、三つ目の構造的特性であるhierarchy(階層)を特定します。複雑な機械学習モデルにおいて、上位の相互作用が重要であれば、その下位のサブセットも重要である可能性が高いです。

この階層構造を活用することで、ProxySPEXはSPEXと同等の性能を達成しながら、約10x fewer ablations(10倍少ないアブレーション)で済ませ、解釈可能性プロセスの計算コストを大幅に削減します。

特徴帰属への応用

標準的な特徴帰属が個々の重要な特徴を特定するのに対し、SPEXはそれらの関係性を捉えます。これは、感情分析における二重否定や、Retrieval-Augmented Generation(RAG)タスクにおける複数文書の統合といったニュアンスを理解する上で重要です。

信頼性とスケーラビリティ

感情分析タスクにおいて、SPEXは高いfaithfulness(忠実度)—回復された帰属が未見のテストアブレーション上でモデル出力を予測する精度—を維持します。たとえコンテキストが数千の特徴に拡大してもです。LIMEやBanzhafのようなマージナル手法もスケール可能ですが、これらは複雑な相互作用を捉えられないため、忠実度が低くなります。

ケーススタディ:トロッコ問題

GPT-4o mini が失敗した(正答率がわずか8%)改変版トロッコ問題を分析した際、標準的なSHAP帰属はエラーの主要因として単語「trolley」を特定しました。しかし、「trolley」を同義語に置き換えてもほとんど効果がありませんでした。SPEXは「trolley」(2回出現)、「pulling」、そして「lever」という単語間の高次シナジーを明らかにしました。これら4つの特定の単語を同義語に置き換えることで、モデルの失敗率はほぼゼロに減少しました。

データ帰属と訓練セットへの影響

ProxySPEXは、訓練データポイントがどのように相互作用して予測に影響を与えるかを特定できます。これにより、研究者は二種類の相互作用を区別できます:

  • Synergistic Interactions: 意味的に異なるクラスが協働して決定境界を定義する相互作用。例えば、自動車の予測はスポーツカーの低プロファイルシャーシ、トラックの箱型形状、配送車の水平ストライプという三つの要素のシナジーによって駆動されることがあります。
  • Redundant Interactions: 特定の概念を強化する視覚的な重複。例えば、似たシルエットの犬画像のクラスターが「馬」予測に影響を与える場合です。

この区別により、冗長性を除去しつつ必要なシナジーを保持するデータ選択手法の開発が可能になります。

機構的解釈可能性とアテンションヘッド帰属

ProxySPEXは、アテンションヘッドなどの内部モデルコンポーネント間の相互作用を特定することを可能にします。

アーキテクチャ的介入

MMLUデータセット(highschool-us-history)において、ProxySPEXに基づくプルーニング戦略は他の手法を上回り、実際に対象タスクでのモデル性能を向上させました。

深さにわたる相互作用構造

モデルの深さの分析により、コンポーネントの相互作用の変化が明らかになりました:

  • Early Layers: 主に線形的な領域で動作し、アテンションヘッドが独立して寄与します。
  • Later Layers: アテンションヘッド間の相互作用が顕著になり、主に同一層内のヘッド間で発生します。

実装と入手可能性

SPEX と ProxySPEX のコードは SHAP-IQ repository に統合されており、https://github.com/mmschlk/shapiq で公開利用可能です。

Sources