aiptimizer/TurboOCR
TurboOCR, >200 img/s OmnidocBench. TensorRT FP16, PP-OCRv6, HTTP + gRPC
何を解決するか
TurboOCRは、画像を構造化されたMarkdownに変換するために設計された、高性能なGPU加速ドキュメントパーサーです。従来のOCRやVLM (Vision Language Model) パーサーの速度のボトルネックを解決し、単一のGPUで1秒間に数百枚の画像を処理することを可能にしながら、フォーム、レシート、および高密度なドキュメントに対して高い精度を維持します。
仕組み
C++、CUDA、およびTensorRTで構築されたこのプロジェクトは、単一のモノリスではなく、特化型モデルのパイプラインを実行するマルチストリームエンジンを実装しています。テキスト検出と認識にはPP-OCRv6を、レイアウト分析にはPP-DocLayoutV3を、表の変換(HTMLへの変換)にはSLANet-Plus、数式の変換(LaTeXへの変換)にはPP-FormulaNet-Sのような特化型モデルを利用しています。システムはHTTPおよびgRPC APIの両方を提供するサーバーとしてデプロイされ、特定のGPUハードウェアに対してパフォーマンスを最適化するために、初回起動時にTensorRTエンジンが自動構築されます。
対象ユーザー
産業規模のドキュメントデジタル化を必要とする開発者や組織、特に低レイテンシと高スループットが極めて重要となる、大量のレシート、フォーム、または学術論文を処理する方を対象としています。
ハイライト
- 極めて高いスループット: RTX 5090において、レシートの処理で最大559枚/秒の処理能力を備えています。
- 構造化された出力: 単純なテキスト抽出を超え、レイアウト分析、読み取り順序、HTMLテーブル、およびLaTeX数式を提供します。
- 柔軟な精度ティア:
tiny、small、およびmediumのモデルティアを提供し、ユーザーが速度と精度のトレードオフを選択できるようにします。 - ネイティブPDFサポート: PDFページを並列でレンダリングおよびOCR処理し、オプションで自動回転も可能です。
- 幅広い言語サポート: デフォルトでラテン文字、中国語、および日本語をカバーし、アラビア語、キリル文字、韓国語、タイ語、およびギリシャ語も追加でサポートしています。
関連
- プロジェクト
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト