docling-project/docling-parse
Simple package to extract text with coordinates from programmatic PDFs
解决的问题
Docling Parse 是一个专门用于从程序生成的 PDF 中提取结构化数据的工具。它解决了准确获取文本、路径和位图图像及其精确空间坐标的问题,这对于高保真文档布局分析和转换至关重要。
工作原理
该库提供了一个 PDF 解析器,可按不同粒度(字符、单词、行)提取内容。它采用两部分配置系统:
- DecodeConfig:处理运行时调优以及页面的处理方式。
- ContentConfig:决定每页需要计算和生成哪些特定元素(如单词、行或位图)。
支持顺序解析以处理简单任务,也提供多线程解析器(DoclingThreadedPdfParser)用于高吞吐量处理多个 PDF,并具备背压管理功能。
适用人群
此工具专为构建文档处理流水线的开发者设计,尤其适用于 PDF 转换、RAG(检索增强生成)系统,或任何需要基于精确坐标提取 PDF 内容的应用程序。
主要亮点
- 细粒度提取:支持字符、单词和行级别的文本提取。
- 坐标感知:为所有提取的文本和图像提供精确坐标。
- 高性能:包含多线程解析器,支持大规模文档集的并行处理。
- 灵活的实体化:允许用户按页面跳过或生成特定内容类型,以优化内存和速度。
- C++ 核心:基于 C++ 后端实现以保证效率,通过 Pybind11 提供 Python 绑定。
相关
- 项目
- 项目
- 项目
- 项目
- 项目