opendataloader-project/opendataloader-pdf

PDF Parser for AI-ready data. Automate PDF accessibility. Open-source.

What it solves

OpenDataLoader PDF は高精度 PDF パーサーで、PDF を AI や LLM パイプライン(RAG など)で使用する構造化データに変換すると同時に、アクセシビリティ対応のスクリーンリーダー対応 Tagged PDF を自動生成し、手作業でのアクセシビリティ修正コストを削減します。

How it works

このツールは主に 2 つの処理モードを提供します:

  • Deterministic Local Mode:高速な Java ベースの処理で、標準的なデジタル PDF からテキスト、見出し、シンプルな表を高速に抽出します。
  • Hybrid AI Mode:枠なし表や LaTeX 数式、スキャン画像など複雑なページを AI バックエンドに回し、精度を向上させます。このモードは 80 以上の言語に対応した OCR を内蔵し、軽量ビジョンモデル(SmolVLM)でチャートや画像の説明を生成します。

アクセシビリティ向上のため、レイアウト解析と自動タグ付けを行い、Well‑Tagged PDF 仕様に基づいて未タグ付け PDF を Tagged PDF に変換します。

Who it’s for

  • AI Engineers:RAG パイプラインを構築し、ソース引用用のバウンディングボックス付きクリーンな Markdown または JSON が必要なエンジニア。
  • Accessibility Specialists:未タグ付け PDF を自動でアクセシブル形式に変換し、ADA、EAA などの国際規格に準拠する必要がある組織。
  • Developers:Python、Node.js、Java の SDK を利用して PDF 解析をアプリに組み込みたい開発者。

Highlights

  • Benchmark Leader:読み順、表、見出しの総合抽出精度(0.907)で No.1。
  • Multi-Format Output:Markdown、JSON(バウンディングボックス付き)、HTML、Tagged PDF にエクスポート可能。
  • AI-Enhanced Extraction:LaTeX 数式抽出と画像・チャートの AI 生成説明をサポート。
  • AI Safety:PDF レイヤーに隠されたプロンプトインジェクション攻撃から保護するフィルタを搭載。
  • Open Source Core:レイアウト解析と自動タグ付け機能は Apache 2.0 ライセンスで提供。