deepdoctection/deepdoctection

A Repo For Document AI

解决的问题

Deepdoctection 旨在处理复杂的文档理解任务。它通过编排用于布局分析、OCR 和分类的各种 AI 模型,解决了将非结构化扫描件或 PDF 文档转换为结构化数据的问题。

工作原理

该库作为一个编排层,构建文档提取的流水线。它集成了多种专业工具和模型:

  • 布局分析与表格识别: 使用 PyTorch 结合 Detectron2 和 Transformers。
  • OCR: 支持 Tesseract、DocTr 和 AWS Textract。
  • 文档与标记分类: 采用 LayoutLM 系列、LiLT 和 Bert 风格的模型。
  • 文本挖掘: 对原生 PDF 使用 pdfplumber。
  • 预处理: 包括通过 jdeskew 或 Tesseract 进行图像纠偏和旋转。
  • 语言检测: 使用基于 Transformer 的模型进行语言识别。

适用对象

需要构建自动化文档处理工作流、从 PDF 和扫描件中提取结构化信息,或针对特定任务微调预训练文档 AI 模型的开发人员和数据科学家。

亮点

  • 模块化流水线: 将多个 OCR 和布局分析工具编排进单个工作流。
  • 广泛的模型支持: 与 Hugging Face Hub 集成,支持 LayoutLM、BERT 和 RoBERTa 等模型。
  • 仅限 PyTorch: 最近的重构确保了深度学习模型之间的一致性支持。
  • 微调能力: 允许用户微调目标检测和分类模型,并评估生成的流水线。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目