lupantech/MathVista
MathVista: data, code, and evaluation for Mathematical Reasoning in Visual Contexts
解决的问题
MathVista 是一个用于评估大型多模态模型(LMM)和大型语言模型(LLM)在视觉上下文中数学推理能力的基准测试。它填补了对基础模型如何处理需要深度视觉理解与组合式数学推理任务的系统性研究空白。
如何工作
该基准测试由 28 个现有多模态数据集和 3 个新创建的数据集(IQTest、FunctionQA、PaperQA)中精选的 6,141 个示例组成。它提供了一种标准化的方法,用于测试模型在几何、代数和统计等各类数学任务上的表现,包含一个用于快速评估的 1,000 个示例的 testmini 子集,以及一个用于全面评估的完整测试集。
适用对象
本项目适用于需要严格衡量其模型解决视觉丰富型数学问题能力的 AI 研究人员和开发者。
主要亮点
- 全面的数据集:整合了来自 31 个不同来源的任务,构建了一个多样化的评估套件。
- 人类基准:提供人类表现基准(准确率 60.3%),用于衡量模型的进展。
- 详细分析:包含数据集探索、可视化工具以及排行榜,用于追踪最先进(SOTA)性能。
- 广泛的模型支持:评估了包括 OpenAI o1、GPT-4o、Claude 3.5 和 Gemini 在内的多种模型。
相关
- 项目
- 项目
- 项目
- 项目
- 项目