ispras/dedoc

Dedoc is a library (service) for automate documents parsing and bringing to a uniform format. It automatically extracts content, logical structure, tables, and meta information from textual electronic documents. (Parse document; Document content extraction; Logical structure extraction; PDF parser; Scanned document parser; DOCX parser; HTML parser

解决的问题

Dedoc 是一个将各种文档格式转换为统一输出格式的通用系统。它解决了从 Office 文档、PDF、图像和 HTML 等半结构化和非结构化数据中提取逻辑结构(如标题和列表)以及内容(表格、文本格式和元数据)的问题。

工作原理

Dedoc 使用专用库和机器学习技术的组合来处理不同文件类型:

  • Office 和 Web 格式: 使用 python-docxBeautifulSoup 等库分析 DOCX、XLSX 和 HTML 的内部表示。
  • PDF: 对可复制的 PDF 使用 pdfminer-six,对图形打印使用自定义解释器来提取格式。
  • 扫描文档: 使用 Tesseract OCR 和 OpenCV 进行图像预处理,并结合机器学习模型检测文档方向、列布局和粗体文本。
  • 结构提取: 无论输入格式如何,都能自动确定文档的层级树结构。

适用人群

专为构建自动文档分析流水线、信息分析系统以及需要结构化数据作为分析第一步的自然语言处理(NLP)系统而设计的开发者。

主要亮点

  • 通用格式支持: 支持 DOC/DOCX、ODT、XLS/XLSX、CSV、TXT、JSON、PDF、HTML 以及图像(PNG、JPG)。
  • 逻辑结构提取: 将文档转换为包含任意层级标题和列表的树结构。
  • 高级 PDF 处理: 自动验证 PDF 中文本层的正确性。
  • 表格识别: 从多种格式中提取表格数据,包括使用轮廓分析识别具有明确边框的复杂多页表格。
  • 可扩展架构: 支持轻松添加新文档格式,并灵活配置输出数据格式。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目