OCR4all/OCR4all

Provides OCR (Optical Character Recognition) services through web applications

解決的問題

OCR4all 提供了一個半自動工作流程,用於對歷史印刷品執行光學字元識別 (OCR)。它旨在讓沒有技術背景的使用者也能從早期印本中獲得高品質的文字識別結果,這些印本通常是標準 OCR 工具難以處理的。

運作方式

該專案整合了多種用於文件分析和文字識別的專業工具,包括 OCRopus、Calamari 以及用於版面分析的 LAREX。它提供了一個主介面和伺服器來管理工作流程,允許使用者進行手動互動,以在自動化失敗時優化結果並提高準確性。

目標使用者

需要將歷史文件和早期印本轉錄為數位文字的研究人員、歷史學家以及沒有技術背景的使用者。

特色亮點

  • 半自動工作流程,允許手動校正與互動。
  • 專為歷史印刷品和早期印本進行了優化。
  • 整合了多種 OCR 引擎和文件分析程式。
  • 提供預先配置的 Docker 映像檔,便於安裝。

相關

  • 專案
  • 專案
  • 專案
  • 專案