docling-project/docling-parse

Simple package to extract text with coordinates from programmatic PDFs

解決的問題

Docling Parse 是專為從程式生成的 PDF 中提取結構化資料而設計的工具。它解決了準確取得文字、路徑與位圖影像及其精確空間座標的問題,這對於高保真文件版面分析與轉換至關重要。

作法說明

此套件提供一個 PDF 解析器,可依不同細緻程度(字元、單字、行)提取內容。採用兩階段設定系統:

  • DecodeConfig:處理執行時調校與頁面處理方式。
  • ContentConfig:決定每頁需計算與實體化的特定元素(如單字、行或位圖)。

支援順序解析以處理簡單任務,也提供多執行緒解析器(DoclingThreadedPdfParser)以高吞吐量處理多個 PDF,並具備背壓管理功能。

適用對象

此工具專為開發文件處理流程的開發者設計,特別適用於 PDF 轉換、RAG(檢索增強生成)系統,或任何需要基於精確座標提取 PDF 內容的應用程式。

主要特色

  • 細粒度提取:支援字元、單字與行級別的文字提取。
  • 座標感知:為所有提取的文字與影像提供精確座標。
  • 高效率:內建多執行緒解析器,支援大規模文件集的平行處理。
  • 彈性實體化:允許使用者依頁面跳過或實體化特定內容類型,以優化記憶體與速度。
  • C++ 核心:以 C++ 後端建構以確保效率,並透過 Pybind11 提供 Python 繫結。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案