MMMU-Benchmark/MMMU

This repo contains evaluation code for the paper "MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI"

解决的问题

它解决了缺乏针对需要专家级、大学级知识和复杂推理能力的多种模态 AI 模型的严格基准测试的问题。现有的大多数基准测试无法充分挑战模型整合不同学术领域特定领域知识的能力。

工作原理

该项目提供两个不同的基准测试:

  • MMMU: 一个包含 30 个学科和 183 个子领域(例如:艺术、商业、科学、健康、人文科学和工程)的 1.15 万个多模态问题的大规模数据集。它使用 32 种不同的图像类型(包括化学结构和乐谱)来测试高级感知和推理能力。
  • MMMU-Pro: 一个更严格的版本,通过过滤掉仅靠文本即可回答的问题、添加合理的干扰选项,以及在问题嵌入图像时使用仅限视觉的输入(迫使模型同时进行阅读和观察)来增加难度。

适用对象

正在构建下一代多模态基础模型的研发人员,他们希望根据人类专家和其他最先进的多模态大模型 (LMMs) 来评估其模型的性能。

亮点

  • 专家级范围:涵盖六个核心学科的大学水平专业知识。
  • 多样化的视觉内容:包括图表、图解和地图等多种类型的图像。
  • 鲁棒的评估:MMMU-Pro 通过消除仅限文本的捷径,专门针对内在推理能力。
  • 全面的数据集划分:提供开发集、验证集和测试集,用于系统的模型微调和评估。