Topdu/OpenOCR
OpenOCR: An Open-Source Toolkit for General-OCR Research and Applications, integrates a unified training and evaluation benchmark, commercial-grade OCR and Document Parsing systems, and faithful reproductions of the core implementations from a wide range of academic papers.
何を解決するか
OpenOCR は「General-OCR」タスクを処理するための包括的なツールキットです。平文、数式、表が混在する複雑なドキュメントを正確に解析する難しさに対処し、学術研究と産業実装のギャップを埋めます。
仕組み
このツールキットは複数の専門的なシステムとモデルを提供します:
- OpenDoc-0.1B:2段階パイプラインを使用する軽量なドキュメント解析システム。まず PP-DocLayoutV2 でレイアウト解析を行い、その後 UniRec-0.1B モデルでテキスト、数式、表を認識します。
- UniRec-0.1B:UniRec40M データセットから完全に再訓練された、0.1B パラメータを持つ統合認識モデル。中国語と英語のテキストおよび数式を認識できます。
- OpenOCR System:SVTRv2 をベースにした実用的な OCR システム。サーバーおよびモバイルモデルをサポートし、中国語および英語のテキスト検出・認識において高い精度を提供します。
- SVTRv2:シーンテキスト認識のベンチマークおよびモデル。CTC を活用し、エンコーダデコーダモデルを上回る精度と速度を実現。特に Union14M などの大規模リアルデータセットで訓練された場合に顕著です。
対象ユーザー
OCR およびドキュメント理解に注力する研究者、および高効率で商業レベルの OCR およびドキュメント解析システムを展開したい開発者や業界パートナー向けです。
特徴
- 超軽量:OpenDoc や UniRec など、パラメータ数がわずか 0.1B のモデルを含む。
- 統合認識:1つのフレームワーク内でテキスト、数式、表を認識可能。
- 高いパフォーマンス:OpenDoc-0.1B は OmniDocBench (v1.5) で 90.57% を達成。OpenOCR システムは PP-OCRv4 より 4.5% の精度向上を実現。
- 広範な互換性:ONNX モデルエクスポートをサポートし、さまざまな環境への統合を容易にします。
関連
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト