aiptimizer/TurboOCR
TurboOCR, >200 img/s OmnidocBench. TensorRT FP16, PP-OCRv6, HTTP + gRPC
What it solves
TurboOCR は、高速な GPU 加速ドキュメントパーサーで、遅い従来の OCR エンジンや重い Vision Language Model(VLM)に代わるものです。テキスト、レイアウト、テーブル、数式といった構造化データを極めて高速に抽出し、完全にローカルかつプライベートに処理します。
How it works
C++、CUDA、TensorRT で構築され、PP-OCRv6 に基づくマルチストリームパイプラインを実装しています。単一のモノリスではなく、以下のような専門モデルのスタックを使用します:
- Text Detection & Recognition:PP-OCRv6(tiny、small、medium の各ティア)でラテン文字、中国語、そして日本語を処理。
- Layout Analysis:PP-DocLayoutV3 を用いて 25 種類の文書クラスを識別し、読取順序を決定。
- Table Extraction:SLANet-Plus でテーブルを HTML に変換。
- Formula Recognition:PP-FormulaNet‑S で数式を LaTeX に変換。
システムはサーバーとしてデプロイされ、HTTP と gRPC の両方の API を提供します。TensorRT エンジンは初回起動時に自動でビルドされ、使用する NVIDIA GPU に最適化されたパフォーマンスを実現します。
Who it’s for
数千件のレシートやフォームを秒単位で処理する必要がある開発者や組織向けです。最新 OCR の精度は欲しいが、VLM ベースのパーサーの遅延やコストは許容できないケースに最適です。
Highlights
- Extreme Throughput:RTX 5090 上で 1 秒あたり最大 559 枚の画像(レシート)を処理可能。
- Structured Output:Markdown、HTML(テーブル用)、LaTeX(数式用)へのエクスポートをサポート。
- Native PDF Support:PDF ページを並列でレンダリング・OCR し、オプションで自動回転も可能。
- Flexible Deployment:1 行の Docker コマンドでデプロイ、組み込みの Prometheus メトリクスで監視可能。
- Multi-Language Support:ラテン文字、中国語、日本語に加え、アラビア文字、キリル文字、韓国語、タイ語、ギリシャ文字などもカバー。