opendataloader-project/opendataloader-pdf

PDF Parser for AI-ready data. Automate PDF accessibility. Open-source.

解決的問題

OpenDataLoader PDF 是一款高精度的 PDF 解析器,專門設計用於將 PDF 轉換為 AI 就緒的結構化資料。它解決了在解析過程中遺失文件結構(如閱讀順序、表格與標題層級)的常見問題,這對 RAG(檢索增強生成)與 LLM 流程至關重要。此外,它還能自動建立標籤 PDF,大幅降低為螢幕閱讀器進行 PDF 可存取性修復所需的高成本與人工工作量。

作法原理

此工具提供兩種主要處理模式:

  1. 決定性本地模式:使用快速的 Java 基礎處理標準數位 PDF。
  2. 混合 AI 模式:將包含無邊框表格、掃描內容或數學公式等複雜頁面導向至 AI 後端,以提升準確度。此模式內建支援 80 多種語言的 OCR,並使用輕量級視覺模型(SmolVLM)來描述圖表與影像。

可將資料提取為 Markdown、JSON(含邊界框)與 HTML 等格式。在可存取性方面,執行版面分析與自動標籤,將未標籤的 PDF 轉換為標籤 PDF。

適用對象

  • AI 工程師:建構 RAG 流程,需要乾淨、結構化的 Markdown 或 JSON 用於分塊與來源引用者。
  • 可存取性專家:需自動建立標籤 PDF 以符合全球可存取性法規(如 ADA、EAA)的組織。
  • 開發者:任何需要程式化從複雜科學或雙欄 PDF 中提取表格、LaTeX 公式與結構化文字者。

主要亮點

  • 基準領先:在閱讀順序、表格與標題三項指標上,整體提取準確率排名第一(0.907)。
  • AI 增強提取:支援 LaTeX 公式提取、AI 生成的圖像/圖表描述,以及掃描文件的 OCR。
  • 可存取性自動化:首個端對端生成標籤 PDF 的開源工具,遵循 Well-Tagged PDF 規範。
  • RAG 就緒輸出:提供每個元素皆含邊界框的結構化 Markdown 與 JSON,支援精確的來源引用。
  • AI 安全性:內建過濾器,可防止隱藏於 PDF 層中的提示注入攻擊。
  • 多語言 SDK:提供 Python、Node.js 與 Java SDK,並支援與 LangChain 集成。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案