OpenAI Activation Atlases

OpenAIは、Googleの研究者と協力して、ニューラルネットワーク内のニューロン間の相互作用を可視化する技術であるActivation Atlasesを開発しました。この手法により、研究者は個々のニューロンの研究を超えて、複数のニューロンの共同表現空間を理解することが可能になり、AIの意思決定という「ブラックボックス」を覗き見る方法を提供します。

Mapping Neural Interactions

Activation atlasesは、既存の特徴量可視化技術を拡張したものです。以前の研究は主に個々のニューロンが何を表しているかに焦点を当てていましたが、Activation atlasesは、ニューロンが相互作用する何十万もの例を収集し、可視化します。この転換により、これらのニューロンが共同で表現する共有空間の可視化が可能になり、ネットワークの内部表現をより包括的な視点で捉えることができます。

Improving AI Auditability and Safety

ニューラルネットワークの内部メカニズムを理解することは、モデルの監査と、重要な場面での展開における安全性を確保するために不可欠です。開発者がコードパスをレビューしたり形式的な検証を行ったりできる従来のソフトウェアとは異なり、ニューラルネットワークには同様の透明性が欠けてています。Activation atlasesは、人間が以下を特定できるようにすることで、この問題に対処します:

  • Spurious Correlations: ネットワークが画像を分類するために、非因果的な相関関係に依存している事例を特定します。
  • Feature Overloading: 2つの異なるクラス間で単一の特徴量が再利用されることで、バグにつながる箇所を発見します。
  • Model Vulnerabilities: 人間が、モデルの内部ロジックの理解に基づいて、モデルを欺くための攻撃を設計できるようにします。

Case Study: Frying Pans vs. Woks

Activation atlasesの有用性を実証するために、研究者は、ネットワークがフライパンと中華鍋(woks)をどのように区別しているかを分析するための特定のアトラスを作成しました。分析の結果、ネットワークは物理的な違い(フライパンは四角っぽく、中華鍋はより丸くて深いなど)を正しく識別していましたが、同時に、麺(noodles)の存在という偽の相関関係にも依存していました。

研究者は、画像の隅に麺を追加することで、モデルが対象物を中華鍋として分類してしまう確率を45%にまで高めることができることが分かりました。特徴量検出器のオーバーロードを標的とした、人間が設計した他の攻撃はさらに効果的で、成功率は最大93%に達しました。この例は、モデルがいかに因果関係のない相関関係を捉えてしまう可能性があるかを示しており、これはAIシステムの公平性とバイアスに関する懸念を鏡のように映し出しています。

Implications for Interpretability

Activation atlasesの成功は、ニューラルネットワークの活性化が人間にとって意味のあるものであることを示唆しています。この発見は、ビジョンモデルにおける強力な解釈可能性が達成可能であるという楽観的な見通しを高め、、AIシステムを不透明な「ブラックボックス」から、透明で監査可能なシステムへと移行させる可能性を秘めています。

Sources