opendataloader-project/opendataloader-pdf

PDF Parser for AI-ready data. Automate PDF accessibility. Open-source.

何を解決するか

OpenDataLoader PDF は、AI対応の構造化データに変換する高精度なPDFパーサーです。パース時に文書の構造(読み順、表、見出し階層など)を失うという一般的な問題に対処し、RAG(Retrieval-Augmented Generation)やLLMパイプラインにおいて極めて重要です。さらに、スクリーンリーダー向けのPDFアクセシビリティ修復の高コスト・手作業を削減するために、タグ付きPDFの自動作成を実現します。

動作方法

このツールは2つの主要な処理モードを提供します:

  1. 決定論的ローカルモード:標準的なデジタルPDFに対して高速なJavaベース処理を使用。
  2. ハイブリッドAIモード:境界のない表、スキャンされたコンテンツ、数式を含む複雑なページをAIバックエンドにルーティングし、より高い精度を実現。このモードには80以上の言語をサポートする組み込みOCR機能と、軽量なビジョンモデル(SmolVLM)を用いたチャートや画像の説明生成機能を備えています。

Markdown、JSON(バウンディングボックス付き)、HTMLなどのフォーマットにデータを抽出できます。アクセシビリティ対応ではレイアウト解析と自動タグ付けを行い、タグなしPDFをタグ付きPDFに変換します。

対象ユーザー

  • AIエンジニア:チャンク化やソース引用に適したクリーンで構造化されたMarkdownまたはJSONを必要とするRAGパイプライン構築者。
  • アクセシビリティ専門家:ADA、EAAなど世界的なアクセシビリティ規制への準拠を求める組織で、タグ付きPDFの自動生成を必要とする方。
  • 開発者:複雑な科学的・多カラムPDFから表、LaTeX数式、構造化テキストをプログラムで抽出したい方。

主な特徴

  • ベンチマークリーダー:読み順、表、見出しの3分野において全体的な抽出精度で#1(0.907)を達成。
  • AI強化抽出:LaTeX数式抽出、AI生成による画像・チャート説明、スキャンドキュメント用OCRをサポート。
  • アクセシビリティ自動化:Well-Tagged PDF仕様に従い、エンドツーエンドでタグ付きPDFを生成する最初のオープンソースツール。
  • RAG対応出力:各要素にバウンディングボックス付きの構造化MarkdownとJSONを提供し、正確なソース引用を可能に。
  • AIセキュリティ:PDFレイヤーに隠されたプロンプトインジェクション攻撃を防止する組み込みフィルターを備える。
  • 多言語SDK:Python、Node.js、JavaのSDKを提供し、LangChainとの統合も可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト