PaddlePaddle/PaddleOCR

Turn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100+ languages.

What it solves

PaddleOCR 是一套完整的工具包,旨在将 PDF 文档和图像转换为结构化、机器可读的数据(如 JSON 和 Markdown)。它解决了从复杂视觉布局(包括自然场景、古代文献和工业部件)中提取文字、表格、公式和图表的问题,使这些数据“LLM‑ready”,可用于 RAG(检索增强生成)和 AI Agent 应用。

How it works

该项目提供多个专门的模型系列,以处理不同的 OCR 任务:

  • PaddleOCR-VL:轻量级视觉语言模型(VLM),将动态分辨率视觉编码器与语言模型结合,执行页面级文档解析和元素识别。
  • PP-OCR:高速、多语言文字检测系统(当前 v6),支持 100 多种语言,并针对服务器和边缘部署(tiny、small、medium)进行优化。
  • PP-StructureV3:具结构感知的转换引擎,将复杂的 PDF 和图像转换为 Markdown 或 JSON,提供表格单元格和文本的细粒度坐标信息。

Who it’s for

它面向构建 AI Agent、RAG 流水线和文档 AI 引擎的开发者,帮助将非结构化视觉数据转化为高质量结构化文本。也适用于在多种硬件上部署 OCR 的工程师,包括 NVIDIA GPU、Intel CPU 和移动设备。

Highlights

  • Multilingual Mastery:支持 100+ 语言的统一模型,减少模型切换的需求。
  • LLM-Ready Output:直接导出为 Markdown 和 JSON,便于与 LLM 无缝集成。
  • High Efficiency:提供超小模型体积(如 PP‑OCRv6 tiny 仅 1.5M 参数),在 CPU 与 GPU 上都有显著的推理加速。
  • Broad Hardware Support:兼容多种后端,包括 OpenVINO、ONNX Runtime、TensorRT 以及各种 AI 加速器。
  • C++ and JS Support:包含 C++ 本地部署方案和基于浏览器的推理 SDK(PaddleOCR.js)。