ConTextual: 評估富文本場景中的多模態推理能力

來自加州大學洛杉磯分校 (UCLA) 的研究人員推出了 ConTextual,這是一個專門的數據集與排行榜,旨在評估大型多模態模型 (LMMs) 在執行上下文敏感的富文本視覺推理方面的能力。此基準測試解決了目前 LMM 評估中的一個關鍵空白,目前的評估往往側重於簡單的指令遵循,而非理解視覺上下文中的文本(例如導航地圖或解讀迷因)所需的聯合推理能力。

數據集組成與範圍

ConTextual 由 506 個具有挑戰性的指令與富文本圖像配對組成。該數據集旨在確保任務需要對文本與視覺線索進行聯合推理才能得出正確答案。它涵蓋了八種真實世界的視覺場景:

  • 時間閱讀
  • 購物
  • 導航
  • 抽象場景
  • 行動應用程式
  • 網頁
  • 資訊圖表
  • 其他自然場景

該數據集以兩種格式提供:包含 100 個實例(包括指令、圖像與參考答案)的驗證集,以及僅包含指令與圖像的測試集。

實驗結果與模型性能

初步實驗評估了 13 個模型,分為三類:增強型 LLMs (GPT-4 結合 OCR/captions)、閉源 LMMs (GPT-4V 與 Gemini-Vision-Pro),以及開源 LMMs (包括 LLaVA-v1.5-13B, ShareGPT4V-7B, 與 Idefics-9B)。

評估方法論

評估採用「LLM-as-a-judge」方法。使用 GPT-4 作為裁判來判斷預測的回答與人類撰寫的參考回答相比是否可接受,因為這種方法顯示出與人類判斷具有最高的相關性。

關鍵性能發現

  • 普遍困境: 與人類表現相比,專有與開源 LMMs 在 ConTextual 數據集上都表現掙扎,這表明模型改進仍有巨大的空間。
  • 領域差距: 專有模型(包括 GPT-4V)在資訊圖表推理與時間閱讀任務中表現不佳。雖然 GPT-4V 在抽象推理方面優於人類——這可能是由於接觸過迷因與語錄——但在人類擅長的時間相關任務中卻失敗了。
  • 開源模型的局限性: LLaVA-1.5-13B 與 ShareGPT-4V-7B 等模型在抽象/自然場景與購物、導航及行動裝置使用等其他領域之間顯示出強大的性能差距,這表明這些領域對於這些模型來說屬於分布外 (out-of-distribution)。
  • 增強型 LLMs 的失敗: 使用 OCR 或圖像描述來增強標準 LLM 會導致性能不佳,人類認可率僅為 17.2%。這突顯了這些任務需要精確的視覺感知與細粒度的視覺-語言對齊,而非簡單的文本轉換。

LMM 開發的未來方向

為了改進上下文敏感的富文本視覺推理,研究人員建議專注於三個主要技術領域:

  1. 增強型圖像編碼器: 開發更強大的編碼器以更好地捕捉視覺細節。
  2. 精確的圖像描述: 創建更高保真度的視覺元素描述。
  3. 細粒度視覺-語言對齊: 改進視覺與文本標記 (tokens) 之間的對齊,以減輕幻覺並提高感知能力。

社群提交指南

研究人員可以透過以下方式將其模型提交至 ConTextual 排行榜:

  • 驗證集: 使用 GitHub 上的自動評估流水線,並透過 Hugging Face 排行榜表單提交將圖像 URL 映射到布林值分數 (0 或 1) 的 JSON 格式結果。
  • 測試集: 直接透過電子郵件將模型預測結果(將圖像 URL 映射到預測回答)發送給研究團隊以進行評估。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch