lupantech/MathVista
MathVista: data, code, and evaluation for Mathematical Reasoning in Visual Contexts
解決的問題
MathVista 是一個專為評估大型多模態模型(LMM)與大型語言模型(LLM)在視覺情境下數學推理能力而設計的基準測試。它彌補了對基礎模型如何處理需要深度視覺理解與組合式數學推理任務的系統性研究之不足。
如何運作
此基準測試由 28 個現有的多模態資料集與 3 個新創建的資料集(IQTest、FunctionQA、PaperQA)中精選的 6,141 個範例組成。它提供了一種標準化的方式,用以測試模型在幾何、代數與統計等各類數學任務上的表現,包含一個用於快速評估的 1,000 範例 testmini 子集,以及一個用於全面評估的完整測試集。
適用對象
本專案適用於需要嚴謹衡量其模型解決視覺豐富型數學問題能力的 AI 研究人員與開發者。
主要亮點
- 全面的資料集:整合來自 31 個不同來源的任務,建構出多樣化的評估套件。
- 人類基準:提供人類表現基準(準確率 60.3%),用以衡量模型的進展。
- 詳細分析:包含資料集探索、視覺化工具以及排行榜,用以追蹤最尖端(SOTA)表現。
- 廣泛的模型支援:評估包括 OpenAI o1、GPT-4o、Claude 3.5 與 Gemini 在內的多種模型。
相關
- 專案
- 專案
- 專案
- 專案
- 專案