deepdoctection/deepdoctection

A Repo For Document AI

解決的問題

Deepdoctection 旨在處理複雜的文件理解任務。它透過編排用於佈局分析、OCR 和分類的各種 AI 模型,解決了將非結構化掃描件或 PDF 文件轉換為結構化數據的問題。

工作原理

該函式庫作為一個編排層,構建文件提取的流水線。它整合了多種專業工具和模型:

  • 佈局分析與表格識別: 使用 PyTorch 結合 Detectron2 和 Transformers。
  • OCR: 支援 Tesseract、DocTr 和 AWS Textract。
  • 文件與標記分類: 採用 LayoutLM 系列、LiLT 和 Bert 風格的模型。
  • 文本挖掘: 對原生 PDF 使用 pdfplumber。
  • 預處理: 包括透過 jdeskew 或 Tesseract 進行圖像校正與旋轉。
  • 語言檢測: 使用基於 Transformer 的模型進行語言識別。

適用對象

需要構建自動化文件處理工作流、從 PDF 和掃描件中提取結構化資訊,或針對特定任務微調預訓練文件 AI 模型的開發人員和數據科學家。

亮點

  • 模組化流水線: 將多個 OCR 與佈局分析工具編排進單一工作流。
  • 廣泛的模型支援: 與 Hugging Face Hub 整合,支援 LayoutLM、BERT 和 RoBERTa 等模型。
  • 僅限 PyTorch: 最近的重構確保了深度學習模型之間的一致性支援。
  • 微調能力: 允許使用者微調目標檢測與分類模型,並評估生成的流水線。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案