opendataloader-project/opendataloader-pdf
PDF Parser for AI-ready data. Automate PDF accessibility. Open-source.
解决的问题
OpenDataLoader PDF 是一款高精度 PDF 解析器,旨在将 PDF 转换为 AI 就绪的结构化数据。它解决了在解析过程中丢失文档结构(如阅读顺序、表格和标题层级)的常见问题,这对 RAG(检索增强生成)和 LLM 流水线至关重要。此外,它还能自动创建带标签的 PDF,以降低屏幕阅读器所需的 PDF 可访问性修复的高成本和人工工作量。
工作原理
该工具提供两种主要处理模式:
- 确定性本地模式:使用快速的 Java 基础处理标准数字 PDF。
- 混合 AI 模式:将包含无边框表格、扫描内容或数学公式等复杂页面路由到 AI 后端,以实现更高精度。此模式内置支持 80 多种语言的 OCR,并使用轻量级视觉模型(SmolVLM)来描述图表和图像。
它可以将数据提取为 Markdown、JSON(带边界框)和 HTML 等格式。在可访问性方面,它执行布局分析和自动标记,将未标记的 PDF 转换为带标签的 PDF。
适用人群
- AI 工程师:构建 RAG 流水线,需要干净、结构化的 Markdown 或 JSON 用于分块和引用来源的人。
- 可访问性专家:需要自动化创建带标签 PDF 以符合全球可访问性法规(如 ADA、EAA)的组织。
- 开发者:任何需要程序化地从复杂科学或双栏 PDF 中提取表格、LaTeX 公式和结构化文本的人。
主要亮点
- 基准领先:在阅读顺序、表格和标题三个维度上,整体提取准确率排名第一(0.907)。
- AI 增强提取:支持 LaTeX 公式提取、AI 生成的图像/图表描述,以及扫描文档的 OCR。
- 可访问性自动化:首个端到端生成带标签 PDF 的开源工具,遵循 Well-Tagged PDF 规范。
- RAG 就绪输出:提供每个元素均带边界框的结构化 Markdown 和 JSON,支持精确的引用来源。
- AI 安全性:内置过滤器,可防止隐藏在 PDF 层中的提示注入攻击。
- 多语言 SDK:提供 Python、Node.js 和 Java SDK,并支持与 LangChain 集成。
相关
- 项目
- 项目
- 项目
- 项目
- 项目