docling-project/docling-parse

Simple package to extract text with coordinates from programmatic PDFs

解决的问题

Docling Parse 是一个专门用于从程序生成的 PDF 中提取结构化数据的工具。它解决了准确获取文本、路径和位图图像及其精确空间坐标的问题,这对于高保真文档布局分析和转换至关重要。

工作原理

该库提供了一个 PDF 解析器,可按不同粒度(字符、单词、行)提取内容。它采用两部分配置系统:

  • DecodeConfig:处理运行时调优以及页面的处理方式。
  • ContentConfig:决定每页需要计算和生成哪些特定元素(如单词、行或位图)。

支持顺序解析以处理简单任务,也提供多线程解析器(DoclingThreadedPdfParser)用于高吞吐量处理多个 PDF,并具备背压管理功能。

适用人群

此工具专为构建文档处理流水线的开发者设计,尤其适用于 PDF 转换、RAG(检索增强生成)系统,或任何需要基于精确坐标提取 PDF 内容的应用程序。

主要亮点

  • 细粒度提取:支持字符、单词和行级别的文本提取。
  • 坐标感知:为所有提取的文本和图像提供精确坐标。
  • 高性能:包含多线程解析器,支持大规模文档集的并行处理。
  • 灵活的实体化:允许用户按页面跳过或生成特定内容类型,以优化内存和速度。
  • C++ 核心:基于 C++ 后端实现以保证效率,通过 Pybind11 提供 Python 绑定。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目