Yuliang-Liu/MultimodalOCR

On the Hidden Mystery of OCR in Large Multimodal Models (OCRBench)

해결하는 문제

이 리포지토리는 대규모 다중모달 모델(LMMs)이 시각적 텍스트를 어떻게 처리하는지 평가하기 위한 벤치마크 스위트를 제공합니다. 다국어 문서 분석, 실제 사진 촬영 문서, 그리고 다양한 글자 체계와 언어에서 복잡한 시각적 텍스트 위치 지정 및 추론 작업에 대한 체계적인 평가 부족을 해결합니다.

작동 방식

이 프로젝트는 세 가지 주요 벤치마크로 구성되어 있습니다.

  • MDPBench: 17개 언어와 다양한 글자 체계를 포함하는 다국어 문서 분석에 중점을 두며, 깨끗한 디지털 페이지와 실제 사진 촬영 문서 모두에서 모델을 테스트합니다.
  • OCRBench v2: 10,000개의 인간 검증된 QA 쌍을 사용하여 31개의 다양한 시나리오(영수증, 수식, 거리 풍경 등)에서 시각적 텍스트 위치 지정 및 추론을 검증하는 대규모 이중 언어 벤치마크입니다.
  • OCRBench: 텍스트 인식, 장면 텍스트 VQA, 문서 VQA, 핵심 정보 추출, 손글씨 수학식 인식을 포함하는 핵심 OCR 기능을 평가하는 원본 벤치마크입니다.

대상 사용자

광학 문자 인식(OCR) 및 문서 이해 작업에서 성능을 측정하고자 하는 대규모 다중모달 모델(LMMs)을 개발하거나 평가하는 연구자 및 개발자입니다.

주요 특징

  • 다국어 범위: MDPBench는 저자원 언어와 로마자 외의 문자 체계를 포함해 총 17개 언어를 커버합니다.
  • 실제 세계 테스트: 디지털 문서와 사진 촬영 문서의 성능을 특별히 평가합니다.
  • 포괄적인 시나리오: OCRBench v2는 31개의 다양한 시각적 텍스트 시나리오를 커버합니다.
  • 인간 검증: 모든 벤치마크는 정확한 평가를 보장하기 위해 고품질의 인간 검증된 애노테이션을 사용합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch