PaddlePaddle/PaddleOCR
Turn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100+ languages.
PaddleOCR – 適用於生產環境的 OCR 與文件 AI 工具包
功能說明
- 將圖像或 PDF 轉換為機器可讀的文本、表格、公式,甚至是完整的文檔結構。
- 輸出結果可直接用於大型語言模型 (LLM) – 提供保留佈局資訊的 JSON 或 Markdown。
- 同時支援經典 OCR(文本檢測與識別)以及針對複雜文件的進階視覺語言解析。
核心組件
| 組件 | 用途 | 重點特性 |
|---|---|---|
| PP‑OCRv6 | 通用場景文本檢測 | 單一模型支援 100+ 種語言,相較於 v5 在檢測能力提升 +4.6 % 且識別能力提升 +5.1 %,在 CPU 上運行速度快 5.2 倍,提供從邊緣端到伺服器端的微型 (1.5 M) 至中型 (34.5 M) 模型尺寸,方便部署。 |
| PaddleOCR‑VL‑1.6 | 用於文件解析的輕量化視覺語言模型 | 0.9 B 參數,在 OmniDocBench v1.6 上達到 96.3 % 的準確度,擅長處理表格、公式、古籍文字與印章;輸出帶有元素座標的 Markdown/JSON。 |
| PP‑StructureV3 | PDF/圖像的結構化轉換 | 提供細粒度的佈局分析(儲存格座標、標題、跨頁表格),並可匯出為 DOCX、Markdown、JSON。 |
| HPD‑Parsing (2026‑07‑22) | 高吞吐量文件解析 | 分層並行解碼,速度達 4,752 tokens / s,相容於 OpenAI 樣式的服務提供方式或本地 vLLM 運行環境。 |
為何對 AI/LLM 工作流至關重要
- LLM 準備就緒的數據:該工具包提供乾淨、結構化的文本以及位置元數據,這正是檢索增強生成 (RAG) 或代理系統 (agentic systems) 所需的。
- 速度與佔用空間:模型尺寸從幾 MB (邊緣端) 到約 35 M 參數 (伺服器端) 不等,支援在 CPU、GPU、XPU、NPU 或透過 ONNX/TensorRT 運行,使其易於嵌入到雲端服務或裝置端應用程式中。
- 生態系統整合:與熱門的 RAG 平台(Dify, RAGFlow, Pathway, Cherry Studio)預建的整合,以及瀏覽器 SDK (
PaddleOCR.js)。
典型工作流程
- 輸入 – 提供圖像、掃描版 PDF 或即時攝影機畫面。
- Pipeline 選擇 – 選擇模型系列:
- PP‑OCRv6 用於快速的多語言文本檢測。
- PP‑StructureV3 用於具備佈局感知能力的轉換。
- PaddleOCR‑VL 用於需要處理表格、公式或古籍文字時的進行深度的 VLM 基礎解析。
- 推理 (Inference) – 在本地 (Python, C++, Java, 等) 運行,或透過託管的 API。後端可以支援 Paddle static/dynamic graph, Transformers, ONNX Runtime, OpenVINO, TensorRT, 等。
- 輸出 – 接收包含文本字串、邊界框 (bounding boxes)、表格結構與可選的 DOCX 檔案的 JSON/Markdown。
- 下游應用 | 將結構化輸出餵給 LLM 進行摘要、問答、知識庫構建,或提供給 RAG 引擎進行檢索。
快速上手
- 線上演示 (Online demo):無需安裝 – 直接在 https://www.paddleocr.com 體驗中心嘗試。
- 本地安裝:
pip install paddleocr(Python 3.8‑3.12)。請參考 PP‑OCR, PaddleOCR‑VL, 或 PP‑StructureV3 的快速入門連結以獲取文件說明。 - 部署:將模型轉換為 ONNX,然後使用 OpenVINO, TensorRT 加速,或進行多 GPU 並行推理。同時也提供 C++/C#/Java 的服務層。
誰在使用它
- 超過 6,000 個 GitHub 專案依賴於 PaddleOCR。
- 已整合至商業 RAG 平台 (Dify, RAGFlow, Cherry Studio) 與 AI 代理框架。
- 被需要高準確度、多語言文件數位化的企業所採用。
總結 PaddleOCR 是一個成熟的開源 OCR 與文件 AI 引擎,它將原始視覺數據轉換為結構化、對 LLM 友好的格式。其模組化模型、多語言覆蓋範圍以及靈活的部署選項,使其成為任何構建 AI 應用程式(需要閱讀與理解文件)的人士的必備解決方案。
相關
- 專案
- Dispatch
- 專案
- Dispatch
- 專案