Topdu/OpenOCR

OpenOCR: An Open-Source Toolkit for General-OCR Research and Applications, integrates a unified training and evaluation benchmark, commercial-grade OCR and Document Parsing systems, and faithful reproductions of the core implementations from a wide range of academic papers.

解決的問題

OpenOCR 是一個專為處理「通用 OCR」任務而設計的綜合性工具包。它解決了包含純文字、數學公式與表格的複雜文件難以準確解析的難題,彌補學術研究與工業部署之間的差距。

工作原理

該工具包提供多個專用系統與模型:

  • OpenDoc-0.1B:一個輕量級文件解析系統,採用兩階段流程。首先透過 PP-DocLayoutV2 進行版面分析,再使用 UniRec-0.1B 模型識別文字、公式與表格。
  • UniRec-0.1B:一個具有 0.1B 參數的統一識別模型,從頭在 UniRec40M 資料集上訓練,可識別中英文文字與公式。
  • OpenOCR System:基於 SVTRv2 的實用 OCR 系統,支援伺服器與行動端模型,為中英文文字檢測與識別提供高準確度。
  • SVTRv2:一個場景文字識別基準與模型,利用 CTC 在準確率與速度上超越編碼器-解碼器模型,尤其在使用 Union14M 等大規模真實資料集訓練時表現突出。

適用對象

適用於專注於 OCR 與文件理解的研究人員,以及希望部署高效率、商用級 OCR 與文件解析系統的開發者與產業合作夥伴。

核心亮點

  • 超輕量:包含 OpenDoc 與 UniRec 等僅 0.1B 參數的模型。
  • 統一識別:可在單一框架內識別文字、公式與表格。
  • 高性能量:OpenDoc-0.1B 在 OmniDocBench (v1.5) 上達成 90.57%,OpenOCR 系統在準確率上比 PP-OCRv4 提升 4.5%。
  • 廣泛相容:支援 ONNX 模型匯出,便於在各類環境中整合。

相關

  • Dispatch
  • 專案
  • 專案
  • 專案
  • 專案