Topdu/OpenOCR
OpenOCR: An Open-Source Toolkit for General-OCR Research and Applications, integrates a unified training and evaluation benchmark, commercial-grade OCR and Document Parsing systems, and faithful reproductions of the core implementations from a wide range of academic papers.
解决的问题
OpenOCR 是一个专为处理「通用 OCR」任务而设计的综合性工具包。它解决了包含纯文本、数学公式和表格的复杂文档难以准确解析的难题,弥合了学术研究与工业部署之间的差距。
工作原理
该工具包提供多个专用系统和模型:
- OpenDoc-0.1B:一个轻量级文档解析系统,采用两阶段流水线。首先通过 PP-DocLayoutV2 进行版面分析,然后使用 UniRec-0.1B 模型识别文本、公式和表格。
- UniRec-0.1B:一个具有 0.1B 参数的统一识别模型,从头开始在 UniRec40M 数据集上训练,可识别中英文文本和公式。
- OpenOCR System:基于 SVTRv2 的实用 OCR 系统,支持服务器和移动端模型,为中英文文本检测与识别提供高精度。
- SVTRv2:一个场景文本识别基准与模型,利用 CTC 在准确率和速度上超越编码器-解码器模型,尤其在使用 Union14M 等大规模真实数据集训练时表现突出。
适用人群
适用于专注于 OCR 和文档理解的研究人员,以及希望部署高效率、商用级 OCR 和文档解析系统的开发者和产业合作伙伴。
核心亮点
- 超轻量:包含 OpenDoc 和 UniRec 等仅 0.1B 参数的模型。
- 统一识别:可在单一框架内识别文本、公式和表格。
- 高性能:OpenDoc-0.1B 在 OmniDocBench (v1.5) 上达到 90.57%,OpenOCR 系统在准确率上比 PP-OCRv4 提升 4.5%。
- 广泛兼容:支持 ONNX 模型导出,便于在各类环境中集成。
相关
- Dispatch
- 项目
- 项目
- 项目
- 项目