MMMU-Benchmark/MMMU
This repo contains evaluation code for the paper "MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI"
解決する課題
エキスパートレベルの大学レベルの知識と複雑な推論を必要とするマルチモーダルAIモデル向けの、厳格なベンチマークの不足に対処します。既存のベンチマークの多くは、多様な学術分野にわたるドメイン固有の知識を統合するモデルの能力を十分に試せていません。
仕組み
このプロジェクトは、2つの異なるベンチマークを提供します:
- MMMU: 30の科目と183のサブフィールド(例:芸術、ビジネス、科学、健康、人文科学、工学)にわたる11.5Kのマルチモーダル問題からなる大規模なデータセット。化学構造式や楽譜を含む32種類の異なる画像タイプを使用し、高度な知覚と推論をテストします。
- MMMU-Pro: より厳格なバージョン。テキストのみで回答可能な問題を排除し、もっともらしい誤答の選択肢を追加し、問題が画像内に埋め込まれている場合に視覚入力のみを使用することで、モデルに読み取りと視覚的認識を同時に行うよう強制し、難易度を高めています。
対象者
自身のモデルのパフォーマンスを、人間の専門家や他の最先端のマルチモーダル大規模モデル(LMMs)と比較評価したい、次世代のマルチモーダル基盤モデルを構築している研究者や開発者。
ハイライト
- エキスパートレベルの範囲: 6つの主要分野にわたる大学レベルの専門知識をカバー。
- 多様なビジュアル: チャート、図解、地図など、幅広い種類の画像を含む。
- 堅牢な評価: MMMU-Proは、テキストのみによるショートカットを排除することで、本質的な推論を特に対象としています。
- 包括的な分割: 体系的なモデルのチューニングと評価のために、開発用、検証用、テスト用のセットを提供。