deepdoctection/deepdoctection
A Repo For Document AI
解决的问题
Deepdoctection 旨在处理复杂的文档理解任务。它通过编排用于布局分析、OCR 和分类的各种 AI 模型,解决了将非结构化扫描件或 PDF 文档转换为结构化数据的问题。
工作原理
该库作为一个编排层,构建文档提取的流水线。它集成了多种专业工具和模型:
- 布局分析与表格识别: 使用 PyTorch 结合 Detectron2 和 Transformers。
- OCR: 支持 Tesseract、DocTr 和 AWS Textract。
- 文档与标记分类: 采用 LayoutLM 系列、LiLT 和 Bert 风格的模型。
- 文本挖掘: 对原生 PDF 使用 pdfplumber。
- 预处理: 包括通过 jdeskew 或 Tesseract 进行图像纠偏和旋转。
- 语言检测: 使用基于 Transformer 的模型进行语言识别。
适用对象
需要构建自动化文档处理工作流、从 PDF 和扫描件中提取结构化信息,或针对特定任务微调预训练文档 AI 模型的开发人员和数据科学家。
亮点
- 模块化流水线: 将多个 OCR 和布局分析工具编排进单个工作流。
- 广泛的模型支持: 与 Hugging Face Hub 集成,支持 LayoutLM、BERT 和 RoBERTa 等模型。
- 仅限 PyTorch: 最近的重构确保了深度学习模型之间的一致性支持。
- 微调能力: 允许用户微调目标检测和分类模型,并评估生成的流水线。
相关
- 项目
- 项目
- 项目
- 项目
- 项目