docling-project/docling-parse

Simple package to extract text with coordinates from programmatic PDFs

해결하는 문제

Docling Parse는 프로그래밍으로 생성된 PDF에서 구조화된 데이터를 추출하기 위한 전용 도구입니다. 정확한 공간 좌표와 함께 텍스트, 경로, 비트맵 이미지를 정확히 추출하는 문제를 해결하며, 높은 정밀도의 문서 레이아웃 분석 및 변환에 필수적입니다.

작동 방식

이 라이브러리는 문자, 단어, 줄 단위로 콘텐츠를 추출할 수 있는 PDF 파서를 제공합니다. 두 가지 구성 시스템을 사용합니다:

  • DecodeConfig: 실행 시 튜닝 및 페이지 처리 방식을 제어합니다.
  • ContentConfig: 각 페이지에서 어떤 특정 요소(단어, 줄, 비트맵 등)를 계산하고 실체화할지를 결정합니다.

간단한 작업에는 순차적 파싱을 지원하며, 여러 PDF를 고처리량으로 처리할 때는 백프레셔어 관리 기능이 있는 멀티스레드 파서(DoclingThreadedPdfParser)도 제공합니다.

대상 사용자

이 도구는 PDF 변환, RAG(Retrieval-Augmented Generation) 시스템, 또는 PDF 콘텐츠의 정확한 좌표 기반 추출이 필요한 애플리케이션을 개발하는 개발자들을 위한 것입니다.

주요 특징

  • 세밀한 추출: 문자, 단어, 줄 단위로 텍스트를 추출할 수 있습니다.
  • 좌표 인식: 추출된 모든 텍스트와 이미지에 정확한 좌표를 제공합니다.
  • 고성능: 대용량 문서 세트를 병렬 처리하기 위한 멀티스레드 파서를 포함합니다.
  • 유연한 실체화: 각 페이지에서 특정 콘텐츠 유형을 건너뛰거나 실체화할 수 있어 메모리와 속도를 최적화할 수 있습니다.
  • C++ 커널: 효율성을 위해 C++ 백엔드를 사용하며, Pybind11를 통해 Python 바인딩을 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트