PaddlePaddle/PaddleOCR

Turn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100+ languages.

What it solves

PaddleOCR は、PDF 文書や画像を構造化された機械可読データ(JSON や Markdown など)に変換するための包括的なツールキットです。自然シーン、古文書、産業部品といった複雑なビジュアルレイアウトからテキスト、表、数式、チャートを抽出する課題を解決し、これらのデータを「LLM‑ready」な形で RAG(Retrieval‑Augmented Generation)や AI エージェントアプリケーションで利用できるようにします。

How it works

本プロジェクトは、さまざまな OCR タスクに対応する複数の専門モデルシリーズを提供します:

  • PaddleOCR-VL:動的解像度ビジュアルエンコーダと語彙モデルを統合した軽量ビジョン‑言語モデル(VLM)で、ページレベルの文書解析と要素認識を実行します。
  • PP-OCR:高速・多言語テキストスポッティングシステム(現在 v6)で、100 以上の言語をサポートし、サーバーおよびエッジ(tiny、small、medium)向けに最適化されています。
  • PP-StructureV3:構造認識変換エンジンで、複雑な PDF や画像を Markdown または JSON に変換し、表セルやテキストの細かい座標情報を提供します。

Who it’s for

AI エージェント、RAG パイプライン、ドキュメント AI エンジンを構築する開発者向けに設計されており、非構造化のビジュアルデータを高品質な構造化テキストに変換する必要がある方に最適です。また、NVIDIA GPU、Intel CPU、モバイルデバイスなど多様なハードウェア上で OCR を展開するエンジニアにも適しています。

Highlights

  • Multilingual Mastery:100 以上の言語を統一モデルでサポートし、モデル切替の必要性を低減。
  • LLM-Ready Output:Markdown と JSON に直接エクスポートでき、LLM とのシームレスな統合が可能。
  • High Efficiency:超小型モデルフットプリント(例:PP‑OCRv6 tiny は 1.5M パラメータ)を提供し、CPU と GPU の推論速度を大幅に向上。
  • Broad Hardware Support:OpenVINO、ONNX Runtime、TensorRT、各種 AI アクセラレータなど、さまざまなバックエンドに対応。
  • C++ and JS Support:C++ ローカルデプロイソリューションとブラウザベースの推論 SDK(PaddleOCR.js)を含む。