MMMU-Benchmark/MMMU

This repo contains evaluation code for the paper "MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI"

해결하는 문제

전문가 수준의 대학 수준 지식과 복잡한 추론을 요구하는 멀티모달 AI 모델을 위한 엄격한 벤치마크의 부족 문제를 해결합니다. 기존의 대부분의 벤치마크는 다양한 학문 분야에 걸친 도메인별 지식을 통합하는 모델의 능력을 충분히 시험하지 못합니다.

작동 방식

이 프로젝트는 두 가지 별도의 벤치마크를 제공합니다:

  • MMMU: 30개 과목 및 183개 세부 분야(예: 예술, 비즈니스, 과학, 보건, 인문학 및 공학)에 걸친 11.5K 멀티모달 문제로 구성된 대규모 데이터셋입니다. 화학 구조 및 악보를 포함한 32가지의 다양한 이미지 유형을 사용하여 고급 인지 및 추론 능력을 테스트합니다.
  • MMMU-Pro: 텍스트만으로 답할 수 있는 문제를 필터링하고, 그럴듯한 오답 선택지를 추가하며, 질문이 이미지 내에 포함된 경우 시각 전용 입력을 사용하여 모델이 읽기와 보기를 동시에 수행하도록 강제함으로써 난이도를 높인 더 엄격한 버전입니다.

대상

자신의 모델 성능을 인간 전문가 및 기타 최첨단 멀티모달 대규모 모델(LMMs)과 비교하여 평가하고자 하는 차세대 멀티모달 파운데이션 모델 구축 연구자 및 개발자.

주요 특징

  • 전문가 수준의 범위: 6개의 핵심 학문 분야에 걸친 대학 수준의 전문 지식을 다룹니다.
  • 다양한 시각 자료: 차트, 도표, 지도와 같은 매우 다양한 이미지 유형을 포함합니다.
  • 강력한 평가: MMMU-Pro는 텍스트 전용 지름길을 제거하여 본질적인 추론 능력을 구체적으로 겨냥합니다.
  • 포괄적인 데이터 분할: 체계적인 모델 튜닝 및 평가를 위해 개발, 검증 및 테스트 세트를 제공합니다.