mindee/doctr

docTR (Document Text Recognition) - a seamless, high-performing & accessible library for OCR-related tasks powered by Deep Learning. Ongoing development and maintenance by t2k.

解決的問題

docTR 提供了一種無縫且易於存取的方式,用於對文件進行光學字元辨識(OCR)。它允許使用者透過定位 PDF、影像或網頁中的文字位置並識別字元,來解析文字資訊,從而將視覺文件資料高效轉換為機器可讀的文字。

工作原理

該套件採用兩階段方法實現端對端 OCR:

  1. 文字檢測:使用 DBNet、LinkNet 或 FAST 等架構定位頁面上的文字位置。
  2. 文字識別:使用 CRNN、SAR、MASTER、ViTSTR、PARSeq 或 VIPTR 等架構識別這些定位文字中的字元。

此外,還提供一個 KIE(關鍵資訊提取)預測器,用於檢測特定類別的資訊(如日期和地址),以及一個 佈局檢測模型,用於識別標題、表格和頁尾等區域。

適用對象

專為希望將高品質 OCR 和文件分析功能整合到其應用程式中的開發者與組織設計,適用於從簡單的腳本分析到使用 FastAPI 的完整 API 部署等各種場景。

主要亮點

  • 靈活的架構:支援多種預訓練模型用於檢測與識別。
  • 多樣的輸入:可處理 PDF、影像和 URL。
  • 文件結構:返回嵌套物件結構(Page、Block、Line、Word),可匯出為 JSON。
  • 佈局與表格分析:支援檢測文件佈局區域與表格結構。
  • 部署就緒:提供 Docker 鏡像與 FastAPI 模板,便於快速整合 API。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案