ispras/dedoc
Dedoc is a library (service) for automate documents parsing and bringing to a uniform format. It automatically extracts content, logical structure, tables, and meta information from textual electronic documents. (Parse document; Document content extraction; Logical structure extraction; PDF parser; Scanned document parser; DOCX parser; HTML parser
解决的问题
Dedoc 是一个将各种文档格式转换为统一输出格式的通用系统。它解决了从 Office 文档、PDF、图像和 HTML 等半结构化和非结构化数据中提取逻辑结构(如标题和列表)以及内容(表格、文本格式和元数据)的问题。
工作原理
Dedoc 使用专用库和机器学习技术的组合来处理不同文件类型:
- Office 和 Web 格式: 使用
python-docx和BeautifulSoup等库分析 DOCX、XLSX 和 HTML 的内部表示。 - PDF: 对可复制的 PDF 使用
pdfminer-six,对图形打印使用自定义解释器来提取格式。 - 扫描文档: 使用 Tesseract OCR 和 OpenCV 进行图像预处理,并结合机器学习模型检测文档方向、列布局和粗体文本。
- 结构提取: 无论输入格式如何,都能自动确定文档的层级树结构。
适用人群
专为构建自动文档分析流水线、信息分析系统以及需要结构化数据作为分析第一步的自然语言处理(NLP)系统而设计的开发者。
主要亮点
- 通用格式支持: 支持 DOC/DOCX、ODT、XLS/XLSX、CSV、TXT、JSON、PDF、HTML 以及图像(PNG、JPG)。
- 逻辑结构提取: 将文档转换为包含任意层级标题和列表的树结构。
- 高级 PDF 处理: 自动验证 PDF 中文本层的正确性。
- 表格识别: 从多种格式中提取表格数据,包括使用轮廓分析识别具有明确边框的复杂多页表格。
- 可扩展架构: 支持轻松添加新文档格式,并灵活配置输出数据格式。
相关
- 项目
- 项目
- 项目
- 项目
- 项目