Topdu/OpenOCR
OpenOCR: An Open-Source Toolkit for General-OCR Research and Applications, integrates a unified training and evaluation benchmark, commercial-grade OCR and Document Parsing systems, and faithful reproductions of the core implementations from a wide range of academic papers.
해결하는 문제
OpenOCR는 '일반 OCR' 작업을 처리하기 위해 설계된 포괄적인 툴킷입니다. 일반 텍스트, 수학 공식, 표가 혼합된 복잡한 문서를 정확하게 분석하는 어려움을 해결하며, 학계 연구와 산업 적용 사이의 격차를 메웁니다.
작동 방식
이 툴킷은 여러 전문적인 시스템과 모델을 제공합니다:
- OpenDoc-0.1B: 두 단계 파이프라인을 사용하는 경량 문서 분석 시스템. 먼저 PP-DocLayoutV2를 통해 레이아웃 분석을 수행한 후, UniRec-0.1B 모델을 사용해 텍스트, 수식, 표를 인식합니다.
- UniRec-0.1B: UniRec40M 데이터셋에서 처음부터 훈련된 0.1B 파라미터를 가진 통합 인식 모델로, 중국어와 영어 텍스트 및 수식을 인식할 수 있습니다.
- OpenOCR System: SVTRv2 기반의 실용적인 OCR 시스템으로, 서버 및 모바일 모델을 지원하며 중국어와 영어 텍스트 탐지 및 인식에서 높은 정확도를 제공합니다.
- SVTRv2: CTC를 활용해 인코더-디코더 모델을 능가하는 정확도와 속도를 제공하는 장면 텍스트 인식 벤치마크 및 모델로, Union14M과 같은 대규모 실데이터셋에서 훈련된 경우 특히 우수합니다.
대상 사용자
OCR 및 문서 이해에 집중하는 연구자, 그리고 고효율의 상용 수준 OCR 및 문서 분석 시스템을 구현하고자 하는 개발자 및 산업 파트너를 위한 것입니다.
주요 특징
- 초경량: OpenDoc 및 UniRec와 같이 파라미터 수가 단 0.1B인 모델을 포함합니다.
- 통합 인식: 단일 프레임워크 내에서 텍스트, 수식, 표를 인식할 수 있습니다.
- 고성능: OpenDoc-0.1B는 OmniDocBench (v1.5)에서 90.57%를 달성했으며, OpenOCR 시스템은 PP-OCRv4보다 정확도에서 4.5% 우수합니다.
- 광범위한 호환성: 다양한 환경에 쉽게 통합할 수 있도록 ONNX 모델 내보내기를 지원합니다.
관련
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트