CLIPにおけるマルチモーダル・ニューロン
OpenAIは、CLIPモデル内に、フォトリアルな画像、スケッチ、または記述されたテキストのいずれとして提示されても、単一の概念に反応して活性化する「マルチモーダル・ニューロン」を特定しました。この発見は、CLIPが人間の脳と同様の抽象化メカニズムを利用していることを示唆しており、同じオブジェクトの多様な視覚的表現を分類できる能力を説明するものです。
マルチモーダル・ニューロンと意味的普遍性
CLIPには、特定の視覚的特徴ではなく、概念の意味的なクラスターに反応するニューロンが含まれています。これは、写真、スケッチ、および女優の名前の記述に対して発火する、人間の脳における「Halle Berry」ニューロンのような生物学的な知見を反映しています。
CLIPにおいて、OpenAIは以下のものに対して活性化する「Spider-Man」ニューロン(CLIP RN50x4の最後から2番目のレイヤーにあるNeuron 244)を特定しました:
- コスチュームを着たSpider-Manのフォトリアルな画像。
- 本物のクモの画像。
- Spider-Manのコミック本のイラスト。
- 「spider」という記述されたテキスト。
特徴の可視化とデータセットの例を用いて、研究者たちは、CLIP RN50x4のニューロンの大部分が解釈可能であり、高い抽象度で複数の異なるケースに反応する「多面的なニューロン」として機能していることを発見しました。これには、感情、動物、有名人、芸術スタイル、さらにはデジタル的な改変に関するニューロンが含まれます。
構成と分類
CLIPは、これらの高レベルなマルチモーダル・ニューロンを構成することで分類を行います。スパースな線形プローブ(sparse linear probe)を用いると、最終的な分類はしばしば複数の概念的ニューロンの組み合わせの結果であることがわかります。
- 視覚的構成: 「貯金箱(piggy bank)」の分類は、「金融(finance)」ニューロンと「磁器(porcelain)」ニューロンを組み合わせることで達成されます。同様に、「Spider-Man」ニューロンは「barn spider」の分類に寄与します。
- テキスト的構成: 言語において、概念はほぼ線形に振る舞います。例えば、モデルは「surprised」という単語を、「shock」と「celebration/hug」の組み合わせとして解釈します。
しかし、この還元的なアプローチは、欠落を招く可能性があります。モデルの「intimate(親密な)」という理解には、「soft smile」と「hearts」が含まれますが、「illness(病気)」は明示的に差し引かれます。そのため、病気の文脈における親密さを考慮することができません。
「欠如した概念」の問題
CLIPのすべての能力が、単一で解釈可能なニューロンによって表されるわけではありません。CLIPは正確なジオロケーション(サンフランシスコの「Twin Peaks」のような特定の近隣地域まで)を実行できますが、研究者たちは特定の「San Francisco」ニューロンを見つけることができませんでした。これは、一部の情報が個別のニューロンではなく、方向(direction)または複雑な多様体(manifold)としてエンコードされていることを示唆しています。
脆弱性:タイポグラフィック・アタック
モデルが高レベルな抽象化に依存していることは、「タイポグラフィック・アタック(typographic attacks)」と呼ばれる新しい攻撃ベクトルを生み出します。CLIPのマルチモーダル・ニューロンは、文字通りな表現と図像的な表現の両方を一般化するため、テキストの画像によってトリガーされる可能性があります。
例えば、「finance」ニューロンは、貯金箱と「$$$"というテキストの両方に反応します。Standard Poodleの画像に「$$$"という文字列を追加することで、モデルを犬を貯金箱として分類するように騙すことができます。これらの攻撃は実用的であり、物理的なオブジェクトにテキストを書き込むことで、紙とペンを使って簡単に実行できます。
バイアスと過剰一般化
CLIPは、インターネット規模の学習データからバイアスを継承しており、それがニューロン内で問題のある関連付けとして現れます:
- 地域的バイアス: 「Middle East」ニューロンはテロリズムに関連付けられ、「immigration」ニューロンはラテンアメリカに反応します。
- 表現の害: あるニューロンは、ゴリラと色の濃い肌の人々に対して同時に発火します。
- 解像度の不一致: 米国やインドのような国々のニューロンは明確に定義されていますが、アフリカ諸国のニューロンは、特定の国家ではなく地域全体に対して発火する傾向があります。
OpenAIは、実務家が展開前にこれらのバイアスを事前に防ぐために、解釈可能性ツールが不可欠であると示唆しています。標準的なテストでは予測や測定が困難な場合があるためです。
研究ツールとモデルのリリース
To facilitate further research into multimodal systems, OpenAI has released the weights for CLIP RN50x4 and RN101. Additionally, the OpenAI Microscope catalog has been updated to include feature visualizations, dataset examples, and text feature visualizations for every neuron in CLIP RN50x4.
To facilitate further research into multimodal systems, OpenAI has released the weights for CLIP RN50x4 and RN101. Additionally, the OpenAI Microscope catalog has been updated to include include feature visualizations, dataset examples, and text feature visualizations for every neuron in CLIP RN50x4.