ConTextual: テキストが豊富なシーンにおけるマルチモーダル推論のベンチマーク

カリフォルニア大学ロサンゼルス校(UCLA)の研究者は、ConTextual と呼ばれる専門的なデータセットとリーダーボードを導入しました。これは、大型マルチモーダルモデル(LMM)が文脈に敏感なテキスト豊富な視覚推論を実行する能力を評価するために設計されています。このベンチマークは、現在の LMM 評価がしばしば単純な指示実行に焦点を当て、テキストを視覚的文脈内で理解するために必要な共同推論(例:地図のナビゲーションやミームの解釈)を欠いているという重要なギャップに対処します。

データセットの構成と範囲

ConTextual は、テキストが豊富な画像と組み合わされた 506 の難解な指示から構成されています。データセットは、タスクが正しい答えに到達するためにテキストと視覚の両方の手がかりを共同で推論する必要があることを保証するよう設計されています。以下の 8 つの実世界の視覚シナリオをカバーしています:

  • 時間読み取り
  • ショッピング
  • ナビゲーション
  • 抽象シーン
  • モバイルアプリケーション
  • ウェブページ
  • インフォグラフィック
  • その他の自然シーン

データセットは 2 つの形式で提供されます:指示、画像、参照回答を含む 100 件のインスタンスからなる検証セットと、指示と画像のみを含むテストデータセットです。

実験結果とモデル性能

初期実験では、13 のモデルを 3 つのカテゴリに分けて評価しました:拡張 LLM(OCR/キャプションと組み合わせた GPT-4)、クローズドソース LMM(GPT-4V と Gemini-Vision-Pro)、オープンソース LMM(LLaVA-v1.5-13B、ShareGPT4V-7B、Idefics-9B など)。

評価手法

評価は「LLM-as-a-judge」アプローチで実施されます。GPT-4 をジャッジとして使用し、予測された応答が人間が作成した参照応答と比較して受容可能かどうかを判断します。この手法は人間の判断と最も高い相関を示したためです。

主な性能結果

  • 全般的な苦戦: プロプライエタリモデルとオープンソースモデルの両方が、ConTextual データセットで人間のパフォーマンスに比べて苦戦しており、モデル改善の大きな機会があることを示しています。
  • ドメインギャップ: GPT-4V を含むプロプライエタリモデルは、インフォグラフィック推論や時間読み取りタスクで性能が低いです。GPT-4V は抽象的な推論で人間を上回りますが(ミームや引用への露出が原因と考えられます)、人間が得意とする時間関連タスクでは失敗します。
  • オープンソースの制限: LLaVA-1.5-13B や ShareGPT-4V-7B などのモデルは、抽象的・自然シーンと、ショッピング、ナビゲーション、モバイル利用といった他のドメイン間で大きな性能差を示します。これはこれらのドメインがモデルにとって分布外であることを示唆しています。
  • 拡張 LLM の失敗: 標準的な LLM に OCR や画像キャプションを組み合わせても性能は低く、人間の承認率はわずか 17.2% にとどまります。これは、これらのタスクが単なるテキスト変換ではなく、精密な視覚認識と細粒度のビジョン・言語アラインメントを必要とすることを示しています。

LMM 開発の今後の方向性

文脈に敏感なテキスト豊富な視覚推論を改善するために、研究者は以下の 3 つの主要技術領域に注力することを提案しています:

  1. 強化された画像エンコーダー: 視覚的ディテールをよりよく捉える、より強力なエンコーダーの開発。
  2. 正確な画像記述: 視覚要素の高忠実度な記述を作成すること。
  3. 細粒度のビジョン・言語アラインメント: 視覚トークンとテキストトークン間のアラインメントを改善し、幻覚を軽減し認識を向上させること。

コミュニティ向け提出ガイドライン

研究者は以下の方法で ConTextual リーダーボードにモデルを提出できます:

  • 検証セット: GitHub の自動評価パイプラインを使用し、画像 URL をブールスコア(0 または 1)にマッピングした JSON 形式で結果を提出します。提出は Hugging Face のリーダーボードフォームから行います。
  • テストセット: 画像 URL を予測応答にマッピングしたモデル予測を、評価のためにメールで研究チームに直接送付します。

Sources