Google DeepMind ビジュアルアラインメント研究

Google DeepMindは、AIの視覚表現を人間の概念階層に合わせる方法を導入し、モデルが表面的な特徴に依存する傾向を減らし、一般化能力を向上させました。この研究は、モデルの視覚世界の内部マップを再編成することで、システムがより堅牢で信頼性が高く、少数ショット学習などのタスクで優れた性能を発揮することを示しています。

AIと人間の視覚の間のミスアライメント

AIの視覚モデルは、しばしば人間と同じ概念レンズを通じて世界を認識することができません。人間は視覚情報を階層的に整理し—車と飛行機がどちらも大きな金属製の乗り物であることを認識します—一方、AIモデルはしばしば背景の色やテクスチャなどの表面的な特徴に焦点を当てます。

このギャップを定量化するために、研究者は認知科学からの「奇抜なものを見つける」タスクを使用しました。被験者は3つの画像のうちどれが合わないかを特定しなければなりません。その結果、体系的なミスアライメントが明らかになりました:人間が強く答えに同意するケースでは、AIモデルはしばしば間違った選択をします。なぜなら、彼らは高レベルの概念カテゴリよりも低レベルの視覚パターンを優先するからです。

ビジュアル表現のための3ステップアラインメントメソッド

人間の判断データセットでモデルを直接ファインチューニングすると、データセットが小さいためオーバーフィッティングに陥りがちです。これを克服するために、Google DeepMindは事前知識を失うことなくモデルの表現を再構築する3ステッププロセスを開発しました:

  1. 教師モデルの作成: 小さなアダプターを事前学習済みのビジョンモデル(SigLIP-SO400M)の上に、THINGSデータセットを使って訓練しました。メインモデルを凍結し、アダプターを正則化することで、研究者は元のトレーニングを忘れずに人間のような判断を模倣する「教師」モデルを作成しました。
  2. 合成データセットの生成: この教師モデルを使って、AligNetという何百万もの人間らしい奇抜なものを見つける決定を含む、100万枚以上の異なる画像からなる巨大なデータセットを生成しました。
  3. 学生モデルのファインチューニング: 他のAIモデル(「学生」)はAligNetデータセットを使ってファインチューニングされました。このデータの多様性によりオーバーフィッティングが防がれ、学生は内部表現マップを深く再構築することができました。

その結果、学生モデルの内部マップは構造化されていないごちゃまぜから、高レベルの概念(例えば動物vs食品)が明確に分離された組織化されたクラスターへとシフトしました。

モデルのパフォーマンスと信頼性への影響

AIの表現を人間の概念階層に合わせることで、認知的および技術的なパフォーマンスの両方で測定可能な改善がもたらされます:

改善された人間アライメント

アラインされたモデルは、奇抜なものを見つけるタスクやマルチアレンジメントタスク(類似度で画像を並べ替える)における人間の判断との一致が顕著に高まりました。研究者はさらにこれらの改善を検証するために、Levelsという新しいデータセットを導入しました。

人間らしい不確実性

アラインされたモデルは、人間の行動と相関する不確実性の形を発展させました;具体的には、モデルの決定の不確実性が人間が選択するのにかかる時間と強く相関しています。

一般化と堅牢性の向上

モデルをより人間に合わせることで、標準的なAIベンチマークでのパフォーマンスが向上しました,以下を含みます:

  • 少数ショット学習: 1枚の画像から新しいカテゴリを学習する能力。
  • 分布シフト: テスト対象の画像の種類が変わっても信頼性の高い決定を下す能力。

結論

ビジョンモデルの内部表現マップを人間の概念階層に従って再編成することにより、Google DeepMindはAIがより直感的で信頼できるものになり得ることを示しました。このアプローチは、表面的なノイズに対してより堅牢で、多様な視覚環境にわたって一般化できる視覚システムを構築するためのスケーラブルなパスを提供します。

Sources