PaddlePaddle/PaddleOCR

Turn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100+ languages.

PaddleOCR – 適用於生產環境的 OCR 與文件 AI 工具包

功能說明

  • 將圖像或 PDF 轉換為機器可讀的文本、表格、公式,甚至是完整的文檔結構。
  • 輸出結果可直接用於大型語言模型 (LLM) – 提供保留佈局資訊的 JSON 或 Markdown。
  • 同時支援經典 OCR(文本檢測與識別)以及針對複雜文件的進階視覺語言解析。

核心組件

組件 用途 重點特性
PP‑OCRv6 通用場景文本檢測 單一模型支援 100+ 種語言,相較於 v5 在檢測能力提升 +4.6 % 且識別能力提升 +5.1 %,在 CPU 上運行速度快 5.2 倍,提供從邊緣端到伺服器端的微型 (1.5 M) 至中型 (34.5 M) 模型尺寸,方便部署。
PaddleOCR‑VL‑1.6 用於文件解析的輕量化視覺語言模型 0.9 B 參數,在 OmniDocBench v1.6 上達到 96.3 % 的準確度,擅長處理表格、公式、古籍文字與印章;輸出帶有元素座標的 Markdown/JSON。
PP‑StructureV3 PDF/圖像的結構化轉換 提供細粒度的佈局分析(儲存格座標、標題、跨頁表格),並可匯出為 DOCX、Markdown、JSON。
HPD‑Parsing (2026‑07‑22) 高吞吐量文件解析 分層並行解碼,速度達 4,752 tokens / s,相容於 OpenAI 樣式的服務提供方式或本地 vLLM 運行環境。

為何對 AI/LLM 工作流至關重要

  • LLM 準備就緒的數據:該工具包提供乾淨、結構化的文本以及位置元數據,這正是檢索增強生成 (RAG) 或代理系統 (agentic systems) 所需的。
  • 速度與佔用空間:模型尺寸從幾 MB (邊緣端) 到約 35 M 參數 (伺服器端) 不等,支援在 CPU、GPU、XPU、NPU 或透過 ONNX/TensorRT 運行,使其易於嵌入到雲端服務或裝置端應用程式中。
  • 生態系統整合:與熱門的 RAG 平台(Dify, RAGFlow, Pathway, Cherry Studio)預建的整合,以及瀏覽器 SDK (PaddleOCR.js)。

典型工作流程

  1. 輸入 – 提供圖像、掃描版 PDF 或即時攝影機畫面。
  2. Pipeline 選擇 – 選擇模型系列:
    • PP‑OCRv6 用於快速的多語言文本檢測。
    • PP‑StructureV3 用於具備佈局感知能力的轉換。
    • PaddleOCR‑VL 用於需要處理表格、公式或古籍文字時的進行深度的 VLM 基礎解析。
  3. 推理 (Inference) – 在本地 (Python, C++, Java, 等) 運行,或透過託管的 API。後端可以支援 Paddle static/dynamic graph, Transformers, ONNX Runtime, OpenVINO, TensorRT, 等。
  4. 輸出 – 接收包含文本字串、邊界框 (bounding boxes)、表格結構與可選的 DOCX 檔案的 JSON/Markdown。
  5. 下游應用 | 將結構化輸出餵給 LLM 進行摘要、問答、知識庫構建,或提供給 RAG 引擎進行檢索。

快速上手

  • 線上演示 (Online demo):無需安裝 – 直接在 https://www.paddleocr.com 體驗中心嘗試。
  • 本地安裝pip install paddleocr (Python 3.8‑3.12)。請參考 PP‑OCR, PaddleOCR‑VL, 或 PP‑StructureV3 的快速入門連結以獲取文件說明。
  • 部署:將模型轉換為 ONNX,然後使用 OpenVINO, TensorRT 加速,或進行多 GPU 並行推理。同時也提供 C++/C#/Java 的服務層。

誰在使用它

  • 超過 6,000 個 GitHub 專案依賴於 PaddleOCR。
  • 已整合至商業 RAG 平台 (Dify, RAGFlow, Cherry Studio) 與 AI 代理框架。
  • 被需要高準確度、多語言文件數位化的企業所採用。

總結 PaddleOCR 是一個成熟的開源 OCR 與文件 AI 引擎,它將原始視覺數據轉換為結構化、對 LLM 友好的格式。其模組化模型、多語言覆蓋範圍以及靈活的部署選項,使其成為任何構建 AI 應用程式(需要閱讀與理解文件)的人士的必備解決方案。

相關

  • 專案
  • Dispatch
  • 專案
  • Dispatch
  • 專案