conjuncts/gmft

Lightweight, performant, deep table extraction

해결하는 문제

PDF 문서에서 표를 신뢰성 있게 추출하는 어려움을 해결합니다. 일반적으로 PDF에는 명확한 추출 방법이 없으며, 디지털 형식으로 변환할 때 표의 구조와 정렬을 유지하는 것이 어렵습니다.

작동 방식

이 도구는 PubTables-1M 데이터셋으로 사전 훈련된 Microsoft의 Table Transformer (TATR) 모델을 사용하여 표 구조를 탐지하고 인식합니다. 성능을 극대화하기 위해 기본적으로 OCR에 의존하지 않고 PDF 내부의 기존 텍스트 위치 정보를 활용합니다. PyPDFium2를 사용하여 고처리량 문서 처리를 수행하며, Pandas 데이터프레임, Markdown, LaTeX, HTML, CSV, JSON 등 다양한 형식으로 결과를 내보낼 수 있습니다.

대상 사용자

과학 논문이나 PDF에서 표 형식 데이터를 추출해야 하는 연구자, 데이터 과학자, 개발자에게 적합합니다. GPU가 필요 없이 CPU에서 실행 가능한 가볍고 고성능 솔루션을 필요로 하는 사용자에게 이상적입니다.

주요 특징

  • 고성능: 다른 인기 있는 추출 도구들과 비교해 CPU 기준 약 10배 빠릅니다.
  • 경량: GPU 필요 없으며, 외부 종속성도 최소화되었습니다 (Tesseract나 Poppler 필요 없음).
  • 다양한 내보내기 형식: 여러 출력 형식을 지원하며, GPT-4 Vision과 같은 시각 기반 LLM에 사용할 수 있는 표의 자르기 이미지도 제공합니다.
  • 고급 구조 지원: 암시적 표 구조, 다중 열 헤더, 셀 병합, 회전된 표를 모두 처리합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트