MMMU-Benchmark/MMMU

This repo contains evaluation code for the paper "MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI"

解決的問題

它解決了缺乏針對需要專家級、大學級知識與複雜推理能力的多元模態 AI 模型的嚴格基準測試的問題。現有的大多數基準測試無法充分挑戰模型整合不同學術領域特定領域知識的能力。

工作原理

該專案提供兩個不同的基準測試:

  • MMMU:一個包含 30 個學科與 183 個子領域(例如:藝術、商業、科學、健康、人文科學與工程)的 1.15 萬個多元模態問題的大規模數據集。它使用 32 種不同的圖像類型(包括化學結構與樂譜)來測試高級感知與推理能力。
  • MMMU-Pro:一個更嚴格的版本,透過過濾掉僅靠文本即可回答的問題、添加合理的干擾選項,以及在問題嵌入圖像時使用僅限視覺的輸入(迫使模型同時進行閱讀與觀察)來增加難度。

適用對象

正在構建下一代多元模態基礎模型的研發人員,他們希望根據人類專家或其他最先進的多元模態大模型 (LMMs) 來評估其模型的性能。

亮點

  • 專家級範圍:涵蓋六個核心學科的大學程度專業知識。
  • 多樣化的視覺內容:包括圖表、圖解與地圖等多種類型的圖像。
  • 強健的評估:MMMU-Pro 透過消除僅限文本的捷徑,專門針對內在推理能力。
  • 全面的數據集劃分:提供開發集、驗證集與測試集,用於系統性的模型微調與評估。