Topdu/OpenOCR
OpenOCR: An Open-Source Toolkit for General-OCR Research and Applications, integrates a unified training and evaluation benchmark, commercial-grade OCR and Document Parsing systems, and faithful reproductions of the core implementations from a wide range of academic papers.
解決的問題
OpenOCR 是一個專為處理「通用 OCR」任務而設計的綜合性工具包。它解決了包含純文字、數學公式與表格的複雜文件難以準確解析的難題,彌補學術研究與工業部署之間的差距。
工作原理
該工具包提供多個專用系統與模型:
- OpenDoc-0.1B:一個輕量級文件解析系統,採用兩階段流程。首先透過 PP-DocLayoutV2 進行版面分析,再使用 UniRec-0.1B 模型識別文字、公式與表格。
- UniRec-0.1B:一個具有 0.1B 參數的統一識別模型,從頭在 UniRec40M 資料集上訓練,可識別中英文文字與公式。
- OpenOCR System:基於 SVTRv2 的實用 OCR 系統,支援伺服器與行動端模型,為中英文文字檢測與識別提供高準確度。
- SVTRv2:一個場景文字識別基準與模型,利用 CTC 在準確率與速度上超越編碼器-解碼器模型,尤其在使用 Union14M 等大規模真實資料集訓練時表現突出。
適用對象
適用於專注於 OCR 與文件理解的研究人員,以及希望部署高效率、商用級 OCR 與文件解析系統的開發者與產業合作夥伴。
核心亮點
- 超輕量:包含 OpenDoc 與 UniRec 等僅 0.1B 參數的模型。
- 統一識別:可在單一框架內識別文字、公式與表格。
- 高性能量:OpenDoc-0.1B 在 OmniDocBench (v1.5) 上達成 90.57%,OpenOCR 系統在準確率上比 PP-OCRv4 提升 4.5%。
- 廣泛相容:支援 ONNX 模型匯出,便於在各類環境中整合。
相關
- Dispatch
- 專案
- 專案
- 專案
- 專案