lupantech/MathVista
MathVista: data, code, and evaluation for Mathematical Reasoning in Visual Contexts
해결하는 문제
MathVista는 시각적 맥락에서 대규모 다중모달 모델(LMM)과 대규모 언어 모델(LLM)의 수학적 추론 능력을 평가하기 위해 설계된 벤치마크입니다. 시각적 이해와 구성적 수학적 추론이 모두 필요한 작업에서 기초 모델이 어떻게 작동하는지에 대한 체계적인 연구 부족을 보완합니다.
작동 방식
이 벤치마크는 기존의 28개 다중모달 데이터셋과 새로 제작한 3개 데이터셋(IQTest, FunctionQA, PaperQA)에서 수집한 총 6,141개의 예제로 구성되어 있습니다. 기하학, 대수학, 통계학 등 다양한 수학적 작업을 표준화된 방식으로 테스트할 수 있도록 하며, 빠른 평가를 위한 1,000개 예제로 구성된 testmini 하위세트와 포괄적인 평가를 위한 전체 테스트 세트를 제공합니다.
대상 사용자
시각적으로 풍부한 수학 문제를 해결할 수 있는 능력을 측정하고자 하는 AI 연구자 및 개발자에게 적합합니다.
주요 특징
- 포괄적인 데이터셋: 31개의 다양한 출처에서 수집된 작업을 통합하여 다양한 평가 환경을 제공합니다.
- 인간 기준 성능: 인간의 성능 기준(정확도 60.3%)을 제공하여 모델의 성과를 측정할 수 있습니다.
- 세부 분석 도구: 데이터셋 탐색 및 시각화 도구와 함께 최신 기술(SOTA) 성능을 추적할 수 있는 리더보드를 포함합니다.
- 광범위한 모델 지원: OpenAI o1, GPT-4o, Claude 3.5, Gemini 등 다양한 모델을 평가 대상으로 합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트