deepdoctection/deepdoctection
A Repo For Document AI
解決的問題
Deepdoctection 旨在處理複雜的文件理解任務。它透過編排用於佈局分析、OCR 和分類的各種 AI 模型,解決了將非結構化掃描件或 PDF 文件轉換為結構化數據的問題。
工作原理
該函式庫作為一個編排層,構建文件提取的流水線。它整合了多種專業工具和模型:
- 佈局分析與表格識別: 使用 PyTorch 結合 Detectron2 和 Transformers。
- OCR: 支援 Tesseract、DocTr 和 AWS Textract。
- 文件與標記分類: 採用 LayoutLM 系列、LiLT 和 Bert 風格的模型。
- 文本挖掘: 對原生 PDF 使用 pdfplumber。
- 預處理: 包括透過 jdeskew 或 Tesseract 進行圖像校正與旋轉。
- 語言檢測: 使用基於 Transformer 的模型進行語言識別。
適用對象
需要構建自動化文件處理工作流、從 PDF 和掃描件中提取結構化資訊,或針對特定任務微調預訓練文件 AI 模型的開發人員和數據科學家。
亮點
- 模組化流水線: 將多個 OCR 與佈局分析工具編排進單一工作流。
- 廣泛的模型支援: 與 Hugging Face Hub 整合,支援 LayoutLM、BERT 和 RoBERTa 等模型。
- 僅限 PyTorch: 最近的重構確保了深度學習模型之間的一致性支援。
- 微調能力: 允許使用者微調目標檢測與分類模型,並評估生成的流水線。
相關
- 專案
- 專案
- 專案
- 專案
- 專案