ExtractPDF4J/ExtractPDF4J
Java PDF table extraction & OCR library. Extract structured tables from text-based and scanned PDFs using stream, lattice (OpenCV-style grid detection), and hybrid parsing.
해결하는 문제
ExtractPDF4J는 텍스트 레이어가 없는 문서(예: 스캔된 청구서, 은행 명세서, 재무 보고서 등)에서 데이터를 수동으로 다시 입력할 필요를 제거합니다. 텍스트 기반 및 이미지가 많은 PDF에서 깨끗한 행과 열을 프로그래밍 방식으로 추출할 수 있는 방법을 제공합니다.
작동 방식
이 라이브러리는 다중 전략을 사용하여 표 데이터를 식별하고 추출합니다:
- StreamParser: Apache PDFBox를 사용하여 텍스트 좌표를 기반으로 텍스트 기반 PDF에서 데이터를 추출합니다.
- LatticeParser: OpenCV를 사용하여 스캔된 또는 이미지 기반 PDF의 선과 격자를 감지하여 표 구조를 구성합니다.
- OcrStreamParser: 텍스트 레이어가 없는 문서에서 텍스트를 읽기 위해 Tesseract OCR을 사용합니다.
- HybridParser: 이러한 전략을 조율하여 문서의 특성에 따라 최적의 방법을 자동으로 선택하거나 병합합니다.
대상 사용자
이 도구는 핀테크, 은행 플랫폼, 분석 플랫폼, 기업용 인제스션 워크플로우 및 AI/ML 파이프라인용 데이터 준비를 위한 생산 환경 기반 문서 처리 파이프라인을 구축하는 개발자들을 위한 것입니다.
주요 특징
- 네이티브 Java 지원: Java 17 이상에서 구동되며 Maven Central에서 제공됩니다.
- OCR 통합: Tesseract와 OpenCV를 사용하여 스캔된 PDF에 대한 내장 지원을 제공합니다.
- 유연한 파싱: 다양한 PDF 유형을 처리할 수 있는 여러 모드(스트림, 래티스, OCR-하이브리드)를 제공합니다.
- 배포 옵션: 빠른 추출을 위한 CLI와 Docker를 통해 REST 기반 통합을 위한 Spring Boot 마이크로서비스를 포함합니다.
- 선언적 구성: 파서 설정을 정의하기 위한 어노테이션 기반 구성 지원.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트