Yuliang-Liu/MonkeyOCR

A lightweight LMM-based Document Parsing Model

해결하는 문제

MonkeyOCR은 문서 파싱의 복잡성, 특히 PDF와 이미지를 Markdown과 같은 구조화된 형식으로 변환하는 과제를 해결하기 위해 설계되었습니다. 텍스트, 수식 및 표를 인식하는 데 있어 더욱 간소화되고 고성능인 접근 방식을 제공함으로써, 번거로운 멀티 도구 파이프라인과 대규모 멀티모달 모델을 전체 페이지 처리에 사용하는 비효율성을 대체하는 것을 목표로 합니다.

작동 원리

이 프로젝트는 Structure-Recognition-Relation (SRR) 삼중 패러다임을 활용합니다. 이 접근 방식은 문서의 구조 식별, 구조 내 콘텐츠 인식, 그리고 서로 다른 콘텐츠 블록 간의 관계 결정이라는 세 가지 핵심 구성 요소에 집중하여 파싱 프로세스를 단순화합니다. 영어와 중국어 문서를 모두 지원하며, 속도와 정확도의 균형을 맞추기 위해 다양한 모델 크기(예: 1.2B 및 3B 파라미터)를 제공합니다.

대상 사용자

이 도구는 복잡한 문서(PDF 또는 이미지)를 구조화된 기계 판독 가능 텍스트로 변환해야 하는 개발자 및 연구자, 특히 수학 공식과 표가 포함된 다국어(영어 및 중국어) 문서를 다루는 분들을 대상으로 합니다.

주요 특징

  • 고성능: OmniDocBench 벤치마크에서 여러 폐쇄형 및 대규모 오픈 소스 VLM(GPT-4o 및 Gemini 2.0-Flash 등)보다 뛰어난 성능을 보여줍니다.
  • 유연한 배포: 광범위한 GPU(4060부터 H800까지)를 지원하며 Docker 배포 옵션을 제공합니다.
  • 포괄적인 출력: 처리된 Markdown 파일, 레이아웃 PDF 및 블록 좌표와 관계를 포함하는 상세한 중간 JSON 결과를 생성합니다.
  • 효율적인 확장성: 1.2B 모델은 성능 저하를 최소화하면서 3B 버전보다 훨씬 빠른 속도(약 36%)를 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트