aiptimizer/TurboOCR

TurboOCR, >200 img/s OmnidocBench. TensorRT FP16, PP-OCRv6, HTTP + gRPC

何を解決するか

TurboOCRは、画像を構造化されたMarkdownに変換するために設計された、高性能なGPU加速ドキュメントパーサーです。従来のOCRやVLM (Vision Language Model) パーサーの速度のボトルネックを解決し、単一のGPUで1秒間に数百枚の画像を処理することを可能にしながら、フォーム、レシート、および高密度なドキュメントに対して高い精度を維持します。

仕組み

C++、CUDA、およびTensorRTで構築されたこのプロジェクトは、単一のモノリスではなく、特化型モデルのパイプラインを実行するマルチストリームエンジンを実装しています。テキスト検出と認識にはPP-OCRv6を、レイアウト分析にはPP-DocLayoutV3を、表の変換(HTMLへの変換)にはSLANet-Plus、数式の変換(LaTeXへの変換)にはPP-FormulaNet-Sのような特化型モデルを利用しています。システムはHTTPおよびgRPC APIの両方を提供するサーバーとしてデプロイされ、特定のGPUハードウェアに対してパフォーマンスを最適化するために、初回起動時にTensorRTエンジンが自動構築されます。

対象ユーザー

産業規模のドキュメントデジタル化を必要とする開発者や組織、特に低レイテンシと高スループットが極めて重要となる、大量のレシート、フォーム、または学術論文を処理する方を対象としています。

ハイライト

  • 極めて高いスループット: RTX 5090において、レシートの処理で最大559枚/秒の処理能力を備えています。
  • 構造化された出力: 単純なテキスト抽出を超え、レイアウト分析、読み取り順序、HTMLテーブル、およびLaTeX数式を提供します。
  • 柔軟な精度ティア: tinysmall、およびmediumのモデルティアを提供し、ユーザーが速度と精度のトレードオフを選択できるようにします。
  • ネイティブPDFサポート: PDFページを並列でレンダリングおよびOCR処理し、オプションで自動回転も可能です。
  • 幅広い言語サポート: デフォルトでラテン文字、中国語、および日本語をカバーし、アラビア語、キリル文字、韓国語、タイ語、およびギリシャ語も追加でサポートしています。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト