docling-project/docling-parse
Simple package to extract text with coordinates from programmatic PDFs
解決的問題
Docling Parse 是專為從程式生成的 PDF 中提取結構化資料而設計的工具。它解決了準確取得文字、路徑與位圖影像及其精確空間座標的問題,這對於高保真文件版面分析與轉換至關重要。
作法說明
此套件提供一個 PDF 解析器,可依不同細緻程度(字元、單字、行)提取內容。採用兩階段設定系統:
- DecodeConfig:處理執行時調校與頁面處理方式。
- ContentConfig:決定每頁需計算與實體化的特定元素(如單字、行或位圖)。
支援順序解析以處理簡單任務,也提供多執行緒解析器(DoclingThreadedPdfParser)以高吞吐量處理多個 PDF,並具備背壓管理功能。
適用對象
此工具專為開發文件處理流程的開發者設計,特別適用於 PDF 轉換、RAG(檢索增強生成)系統,或任何需要基於精確座標提取 PDF 內容的應用程式。
主要特色
- 細粒度提取:支援字元、單字與行級別的文字提取。
- 座標感知:為所有提取的文字與影像提供精確座標。
- 高效率:內建多執行緒解析器,支援大規模文件集的平行處理。
- 彈性實體化:允許使用者依頁面跳過或實體化特定內容類型,以優化記憶體與速度。
- C++ 核心:以 C++ 後端建構以確保效率,並透過 Pybind11 提供 Python 繫結。
相關
- 專案
- 專案
- 專案
- 專案
- 專案