opendatalab/OmniDocBench
[CVPR 2025] A Comprehensive Benchmark for Document Parsing and Evaluation
OmniDocBench – 문서 분석 모델을 위한 벤치마크
무엇인가요 – OmniDocBench는 AI 시스템이 복잡한 문서(PDF)를 얼마나 잘 분석할 수 있는지 측정하기 위한 공개 데이터셋 + 평가 도구입니다. 레이아웃 블록 탐지, 텍스트 인식, 표 추출, 수식 읽기, 올바른 독해 순서 유지 등 전체 파이프라인을 대상으로 합니다.
왜 중요한가요 – 현대의 다중 모달 모델(예: OCR 기능이 있는 시각-언어 모델)은 일반적으로 단순한 텍스트 OCR이나 표 탐지와 같은 좁은 작업에서 평가됩니다. 실제 세계의 PDF는 다양한 요소 유형, 언어, 레이아웃이 혼합되어 있습니다. OmniDocBench는 연구자들이 일관된 메트릭을 사용해 에ンド투엔드 시스템과 모듈 단위 모두에서 이러한 모든 측면을 비교할 수 있도록 하는 단일하고 풍부하게 주석이 달린 벤치마크를 제공합니다.
주요 기능 (README에 설명됨)
- 다양한 콘텐츠 – 1,651개의 PDF 페이지로 구성된 10개의 문서 카테고리(학술 논문, 재무 보고서, 신문, 교과서, 수기 메모 등), 5가지 레이아웃 스타일(단일, 이중, 삼중, 혼합, 기타), 5개 언어 그룹(영어, 간체중국어, 혼합 등)
- 세부적인 주석 –
- 블록 수준: 28개 카테고리(제목, 단락, 그림, 표, 수식, 헤더/푸터, 코드 블록, 참고문헌 등)
- 스팬 수준: 4개 카테고리(텍스트 줄, 인라인 수식, 각주 표시, 무시된 수식)
- 각 요소는 다각형 좌표, 독해 순서 인덱스, 그리고 인식 정답(일반 텍스트, 수식은 LaTeX, 표는 LaTeX + HTML)을 저장합니다.
- 페이지, 표, 텍스트 블록, 수식에 대한 추가 속성 태그(예: 언어, 레이아웃 유형, 워터마크, 스캔 품질, 표 테두리, 수식 유형)
- 고품질 주석 – 수동 검토, 지능형 사전 주석, 전문가 및 대규모 모델 검증의 조합
- 평가 코드 – 오픈소스 Python 파이프라인으로 에ンド투엔드 또는 모듈 단위(레이아웃 탐지, OCR, 표 인식, 수식 인식, 독해 순서) 평가 가능. 여러 기존 메트릭 지원:
- 텍스트: 정규화된 편집 거리, BLEU, METEOR
- 표: TEDS, 편집 거리
- 수식: CDM(콘텐츠 의존 메트릭) 및 편집 거리
- 레이아웃 탐지: COCODet 스타일 mAP/mAR
- 다중 정밀도 적응 매칭(MGAM) – v1.6에서 도입된, 예측의 정밀도를 조정하여 편향을 최소화하는 매칭 알고리즘
- 간편한 배포 – 재현 가능한 환경(파이썬 3.10, TeX Live 2025, ImageMagick 7, Ghostscript)을 갖춘 Docker 이미지와 Conda 기반 백업 옵션
- 커뮤니티 통합 – OpenAI 호환 엔드포인트에 대해 벤치마크를 실행할 수 있는 EvalScope 지원
일반적인 워크플로우
- 정답 JSON 준비(README에 표시된 형식)와 모델의 예측을 동일한 구조로 준비.
- 각 요소 유형에 대해 계산할 메트릭을 지정하는 설정 YAML 파일 작성.
- Docker 컨테이너 또는 Conda 환경 내에서 파이프라인 실행(
python pdf_validation.py --config …). - 결과 확인 – 전체 점수에 더해 페이지별 및 속성별 분해 결과를 확인하여 모델이 어려움을 겪는 부분(예: 수기 메모, 밀집된 수식, 회전된 표)을 파악할 수 있음.
누가 사용할까
- 다중 모달 시각-언어 모델, OCR 엔진, 전용 문서 이해 시스템을 개발하는 연구자
- 문서 자동화 파이프라인을 벤치마크해야 하는 기업(청구서 처리, 학술 문헌 마이닝, 재무 보고서 분석)
- 논문이나 제품 문서에서 결과를 보고하기 위해 표준화된 다국어, 다레이아웃 테스트 세트를 원하는 누구나
다운로드 위치
- 데이터셋: Hugging Face Hub (
opendatalab/OmniDocBench) 및 OpenDataLab - 코드 및 문서: 이 GitHub 리포지토리 (
opendatalab/OmniDocBench) - 논문: 헤더에 제공된 arXiv 링크
TL;DR – OmniDocBench는 포괄적인 문서 분석 평가를 위한 진정한, 지속적으로 유지 관리되는 벤치마크로, 세부 주석이 달린 대규모 다형 PDF 데이터셋과 즉시 실행 가능한 평가 스크립트를 제공합니다.
관련
- 프로젝트
- 프로젝트
- Dispatch
- 프로젝트
- 프로젝트