PaddlePaddle/PaddleOCR

Turn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100+ languages.

PaddleOCR – 本番環境対応の OCR & Document‑AI ツールキット

何ができるか

  • 画像や PDF を、機械判読可能なテキスト、表、数式、さらには文書全体の構造へと変換します。
  • 出力は Large Language Models (LLM) 用に最適化されています。レイアウト情報を保持した JSON または Markdown が出力されます。
  • 従来の OCR(テキストの検出と認識)と、複雑な文書向けの高度な vision‑language 解析の両方をサポートしています。

主要コンポーネント

Component Purpose Highlights
PP‑OCRv6 汎用シーンテキスト検出 単一モデルで 100 以上の言語に対応、v5 と比較して検出率 +4.6%、認識率 +5.1%、CPU 上で 5.2 倍高速、エッジからサーバーへのデプロイに適した tiny (1.5 M) から medium (34.5 M) のモデルサイズ
PaddleOCR‑VL‑1.6 文書解析用の軽量 Vision‑Language Model 0.9 B パラメータ、OmniDocBench v1.6 で 96.3% の精度、表、数式、古文書、印影に優れ、要素の座標を含む Markdown/JSON を出力
PP‑StructureV3 PDF/画像の構造化変換 きめ細かなレイアウト(セル座標、見出し、ページをまたぐ表)を生成し、DOCX、Markdown、JSON へエクスポート可能
HPD‑Parsing (2026‑07‑22) 高スループット文書解析 階層的並列デコード、4,752 tokens / s、OpenAI スタイルのサービングまたはローカル vLLM ランタイムと互換

AI/LLM パイプラインにおける重要性

  • LLM 用のデータ: このツールキットは、クリーンで構造化されたテキストと位置メタデータを生成します。これは、Retrieval‑Augmented Generation (RAG) やエージェント型システムにまさに必要とされるものです。
  • 速度とフットプリント: モデルは数メガバイト(エッジ用)から約 35 M パラメータ(サーバー用)まで幅広く、CPU、GPU、XPU、NPU、または ONNX/TensorRT 経由で動作します。これにより、クラウドサービスやデバイス上でのアプリへの組み込みが容易になります。
  • エコシステムとの連携: 人気のある RAG プラットフォーム(Dify, RAGFlow, Pathway, Cherry Studio)やブラウザ SDK (PaddleOCR.js) との事前構築された統合機能があります。

一般的なワークフロー

  1. Input – 画像、スキャンされた PDF、またはライブカメラのフレームを提供します。
  2. Pipeline selection – モデルファミリーを選択します:
    • PP‑OCRv6:高速な多言語テキスト検出用。
    • PP‑StructureV3:レイアウトを考慮した変換用。
    • PaddleOCR‑VL:表、数式、または古文書の深い VLM ベースの解析が必要な場合用。
  3. Inference – ローカル(Python, C++, Java, など)またはホストされた API を介して実行します。バックエンドは Paddle static/dynamic graph, Transformers, ONNX Runtime, OpenVINO, TensorRT, などが利用可能です。
  4. Output – テキスト文字列、バウンディングボックス、表の構造、およびオプションの DOCX ファイルを含む JSON/Markdown を受け取ります。
  5. Downstream – 構造化された出力を LLM に渡し、要約、Q&A、知識ベースの構築、または RAG エンジンへの検索用として利用します。

はじめに

  • Online demo: インストール不要で、https://www.paddleocr.com の Experience Center を試すことができます。
  • Local install: pip install paddleocr (Python 3.8-3.12) を実行します。PP‑OCR, PaddleOCR‑VL, または PP‑StructureV3 のドキュメントへのクイックスタートリンクに従ってください。
  • Deployment: モデルを ONNX に変換し、OpenVINO, TensorRT, またはマルチ GPU による並列推論を実行して高速化します。C++/C#/Java のサービング層も提供されています。

利用シーン

  • 6,000 件以上の GitHub プロジェクトが PaddleOCR に依存しています。
  • 商用 RAG プラットフォーム(Dify, RAGFlow, Cherry Studio)に統合されています。
  • 高精度かつ多言語の文書デジタル化を必要とする企業によって採用されています。

結論 PaddleOCR は、成熟したオープンソースの OCR および Document‑AI エンジンであり、生の視覚データを、構造化された LLM 用に最適な形式へと橋渡しします。そのモジュール式モデル、多言語対応、および柔軟なデプロイメントオプションにより、文書を読み取り、理解する AI アリプリケーションを構築するすべての人にとって、最適なソリューションとなります。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • Dispatch
  • プロジェクト