aiptimizer/TurboOCR

TurboOCR, >200 img/s OmnidocBench. TensorRT FP16, PP-OCRv6, HTTP + gRPC

What it solves

TurboOCR は、高速な GPU 加速ドキュメントパーサーで、遅い従来の OCR エンジンや重い Vision Language Model(VLM)に代わるものです。テキスト、レイアウト、テーブル、数式といった構造化データを極めて高速に抽出し、完全にローカルかつプライベートに処理します。

How it works

C++、CUDA、TensorRT で構築され、PP-OCRv6 に基づくマルチストリームパイプラインを実装しています。単一のモノリスではなく、以下のような専門モデルのスタックを使用します:

  • Text Detection & Recognition:PP-OCRv6(tiny、small、medium の各ティア)でラテン文字、中国語、そして日本語を処理。
  • Layout Analysis:PP-DocLayoutV3 を用いて 25 種類の文書クラスを識別し、読取順序を決定。
  • Table Extraction:SLANet-Plus でテーブルを HTML に変換。
  • Formula Recognition:PP-FormulaNet‑S で数式を LaTeX に変換。

システムはサーバーとしてデプロイされ、HTTP と gRPC の両方の API を提供します。TensorRT エンジンは初回起動時に自動でビルドされ、使用する NVIDIA GPU に最適化されたパフォーマンスを実現します。

Who it’s for

数千件のレシートやフォームを秒単位で処理する必要がある開発者や組織向けです。最新 OCR の精度は欲しいが、VLM ベースのパーサーの遅延やコストは許容できないケースに最適です。

Highlights

  • Extreme Throughput:RTX 5090 上で 1 秒あたり最大 559 枚の画像(レシート)を処理可能。
  • Structured Output:Markdown、HTML(テーブル用)、LaTeX(数式用)へのエクスポートをサポート。
  • Native PDF Support:PDF ページを並列でレンダリング・OCR し、オプションで自動回転も可能。
  • Flexible Deployment:1 行の Docker コマンドでデプロイ、組み込みの Prometheus メトリクスで監視可能。
  • Multi-Language Support:ラテン文字、中国語、日本語に加え、アラビア文字、キリル文字、韓国語、タイ語、ギリシャ文字などもカバー。