Yuliang-Liu/MultimodalOCR
On the Hidden Mystery of OCR in Large Multimodal Models (OCRBench)
解决的问题
本仓库提供了一套基准测试,用于评估大型多模态模型(LMMs)处理视觉文本的能力。它解决了多语言文档解析、真实世界拍摄文档,以及跨多种文字和语言的复杂视觉文本定位与推理任务缺乏系统性评估的问题。
工作原理
该项目包含三个主要基准测试:
- MDPBench:专注于17种语言和多种文字体系的多语言文档解析,测试模型在干净的数字页面和真实世界拍摄文档上的表现。
- OCRBench v2:一个大规模双语基准测试,使用10,000个经过人工验证的问答对,测试31种不同场景(如收据、公式、街景)中的视觉文本定位与推理能力。
- OCRBench:原始基准测试,评估核心OCR能力,包括文本识别、场景文本VQA、文档VQA、关键信息提取以及手写数学表达式识别。
适用对象
需要衡量其在光学字符识别(OCR)和文档理解任务上性能的大型多模态模型(LMMs)的研究人员和开发者。
亮点
- 多语言覆盖:MDPBench涵盖17种语言,包括低资源语言和非拉丁字母文字体系。
- 真实世界测试:特别评估模型在拍摄文档与数字文档上的表现差异。
- 全面场景覆盖:OCRBench v2涵盖31种不同的视觉文本场景。
- 人工验证:所有基准测试均使用高质量的人工验证标注,确保评估的准确性。
相关
- 项目
- 项目
- 项目
- 项目
- Dispatch