docling-project/docling-parse

Simple package to extract text with coordinates from programmatic PDFs

何を解決するか

Docling Parse は、プログラム生成 PDF から構造化データを抽出するための専門的なツールです。正確にテキスト、パス、ビットマップ画像とその正確な空間座標を取得する問題を解決し、高精度なドキュメントレイアウト解析および変換に不可欠です。

動作方法

このライブラリは、文字、単語、行という異なる粒度でコンテンツを抽出できる PDF パーサーを提供します。2段階の構成システムを使用しています:

  • DecodeConfig:実行時のチューニングとページの処理方法を制御します。
  • ContentConfig:各ページでどの特定の要素(単語、行、ビットマップなど)を計算および実体化するかを決定します。

単純なタスクには順次解析をサポートし、複数の PDF を高スループットで処理する場合にバックプレッシャー管理付きのマルチスレッドパーサー(DoclingThreadedPdfParser)も提供しています。

対象ユーザー

このツールは、ドキュメント処理パイプラインを開発する開発者向けに設計されており、特に PDF 変換、RAG(Retrieval-Augmented Generation)システム、または PDF コンテンツの正確な座標ベース抽出を必要とするアプリケーションを構築している人にとって適しています。

特徴

  • 細粒度抽出:文字、単語、行レベルでのテキスト抽出を可能にします。
  • 座標対応:抽出されたすべてのテキストおよび画像に正確な座標を提供します。
  • 高パフォーマンス:並列処理のためのマルチスレッドパーサーを備えています。
  • 柔軟な実体化:各ページで特定のコンテンツタイプをスキップまたは実体化できるため、メモリと速度を最適化できます。
  • C++ コア:効率性を追求した C++ ベースのコアを持ち、Pybind11 を通じて Python バインディングを提供しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト