lupantech/MathVista
MathVista: data, code, and evaluation for Mathematical Reasoning in Visual Contexts
何を解決するか
MathVistaは、視覚的文脈において大規模マルチモーダルモデル(LMM)および大規模言語モデル(LLM)の数学的推論能力を評価するためのベンチマークです。視覚的理解と構成的数学的推論の両方を必要とするタスクにおける基礎モデルの処理方法について、体系的な研究の不足を補います。
仕組み
このベンチマークは、28の既存マルチモーダルデータセットと3つの新規作成データセット(IQTest、FunctionQA、PaperQA)から収集された6,141の例で構成されています。幾何学、代数、統計など、さまざまな数学的タスクを標準化された方法でテストできるように設計されており、迅速な評価用に1,000例のtestminiサブセットと、包括的な評価用のフルテストセットを提供します。
対象ユーザー
大規模マルチモーダルモデルを開発・研究するAI研究者や開発者向けです。視覚的に豊かな数学的問題を解く能力を厳密に測定したい方におすすめです。
特徴
- 包括的なデータセット:31の異なるソースからのタスクを統合し、多様な評価環境を構築。
- 人間のベースライン:人間のパフォーマンスベースライン(60.3%の正解率)を提供し、モデルの進歩を測定可能。
- 詳細な分析ツール:データセットの探索・可視化ツールと、最先端(SOTA)パフォーマンスを追跡するリーダーボードを備えています。
- 広範なモデル対応:OpenAI o1、GPT-4o、Claude 3.5、Geminiなど、幅広いモデルを評価対象としています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト