PaddlePaddle/PaddleOCR

Turn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100+ languages.

What it solves

PaddleOCR 是一套完整的工具套件,旨在將 PDF 文件與影像轉換為結構化、機器可讀的資料(如 JSON 與 Markdown)。它解決了從複雜視覺版面(包括自然場景、古代文件與工業元件)中擷取文字、表格、公式與圖表的問題,讓這些資料「LLM‑ready」可用於 RAG(檢索增強生成)與 AI Agent 應用。

How it works

此專案提供多個專門的模型系列,以處理不同的 OCR 任務:

  • PaddleOCR-VL:輕量化的視覺‑語言模型(VLM),結合動態解析度的視覺編碼器與語言模型,執行頁面層級的文件解析與元素辨識。
  • PP-OCR:高速、多語言文字偵測系統(目前 v6),支援超過 100 種語言,並針對伺服器與邊緣部署(tiny、small、medium)進行最佳化。
  • PP-StructureV3:具結構感知的轉換引擎,將複雜的 PDF 與影像轉換為 Markdown 或 JSON,提供表格儲存格與文字的細粒度座標資訊。

Who it’s for

此工具套件為開發 AI Agent、RAG 流程與文件 AI 引擎的開發者而建,協助將非結構化的視覺資料轉換為高品質的結構化文字。亦適用於在多樣硬體上部署 OCR 的工程師,包含 NVIDIA GPU、Intel CPU 與行動裝置。

Highlights

  • Multilingual Mastery:支援 100+ 種語言的統一模型,減少模型切換的需求。
  • LLM-Ready Output:直接匯出為 Markdown 與 JSON,方便與 LLM 無縫整合。
  • High Efficiency:提供超小模型尺寸(例如 PP‑OCRv6 tiny 只有 1.5M 參數),在 CPU 與 GPU 上皆有顯著的推論加速。
  • Broad Hardware Support:相容多種後端,包括 OpenVINO、ONNX Runtime、TensorRT 與各類 AI 加速器。
  • C++ and JS Support:內含 C++ 本地部署方案與瀏覽器端推論 SDK(PaddleOCR.js)。