PaddlePaddle/PaddleOCR

Turn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100+ languages.

PaddleOCR – 프로덕션급 OCR 및 문서 AI 툴킷

주요 기능

  • 이미지 또는 PDF를 기계 판독 가능한 텍스트, 표, 수식 및 전체 문서 구조로 변환합니다.
  • 출력물은 레이아웃 정보를 보존하는 JSON 또는 Markdown 형식으로, 대규모 언어 모델(LLM)에 즉시 사용 가능합니다.
  • 전통적인 OCR(텍스트 탐지 및 인식)과 복잡한 문서를 위한 고급 비전-언어 파싱을 모두 지원합니다.

핵심 구성 요소

구성 요소 목적 주요 특징
PP‑OCRv6 범용 장면 텍스트 탐지 단일 모델로 100개 이상의 언어 지원, v5 대비 탐지 +4.6% 및 인식 +5.1% 향상, CPU에서 5.2배 빠름, 엣지-서버 배포를 위한 tiny (1.5M) – medium (34.5M) 모델 크기
PaddleOCR‑VL‑1.6 문서 파싱을 위한 경량 비전-언어 모델 0.9B 파라미터, OmniDocBench v1.6에서 96.3% 정확도, 표, 수식, 고대 문자, 인장에 탁월; 요소 좌표가 포함된 Markdown/JSON 출력
PP‑StructureV3 PDF/이미지의 구조적 변환 세밀한 레이아웃(셀 좌표, 제목, 페이지 간 표) 생성 및 DOCX, Markdown, JSON으로 내보내기 가능
HPD‑Parsing (2026‑07‑22) 고처리량 문서 파싱 계층적 병렬 디코딩, 4,752 tokens/s, OpenAI 스타일 서빙 또는 로컬 vLLM 런타임과 호환

AI/LLM 파이프라인에 중요한 이유

  • LLM 친화적 데이터: 이 툴킷은 검색 증강 생성(RAG) 또는 에이전트 시스템에 꼭 필요한 깨끗하고 구조화된 텍스트와 위치 메타데이터를 제공합니다.
  • 속도 및 크기: 모델은 몇 메가바이트(엣지)에서 약 35M 파라미터(서버)까지 다양하며 CPU, GPU, XPU, NPU 또는 ONNX/TensorRT를 통해 실행할 수 있어 클라우드 서비스나 온디바이스 앱에 통합하기 쉽습니다.
  • 생태계 연결: 인기 있는 RAG 플랫폼(Dify, RAGFlow, Pathway, Cherry Studio) 및 브라우저 SDK (PaddleOCR.js)와의 사전 구축된 통합을 제공합니다.

일반적인 워크플로우

  1. 입력 – 이미지, 스캔된 PDF 또는 실시간 카메라 프레임을 제공합니다.
  2. 파이프라인 선택 – 모델 제품군을 선택합니다:
    • 빠른 다국어 텍스트 탐지를 위한 PP‑OCRv6.
    • 레이아웃 인지 변환을 위한 PP‑StructureV3.
    • 표, 수식 또는 고대 문자가 필요한 경우 심층 VLM 기반 파싱을 위한 PaddleOCR‑VL.
  3. 추론 – 로컬(Python, C++, Java 등) 또는 호스팅된 API를 통해 실행합니다. 백엔드는 Paddle static/dynamic graph, Transformers, ONNX Runtime, OpenVINO, TensorRT 등을 지원합니다.
  4. 출력 – 텍스트 문자열, 경계 상자(bounding boxes), 표 구조 및 선택적 DOCX 파일이 포함된 JSON/Markdown을 받습니다.
  5. 다운스트림 – 구조화된 출력을 요약, 질의응답, 지식 베이스 구축을 위해 LLM에 전달하거나 검색을 위해 RAG 엔진에 전달합니다.

시작하기

  • 온라인 데모: 설치가 필요 없습니다. https://www.paddleocr.com 의 Experience Center를 이용해 보세요.
  • 로컬 설치: pip install paddleocr (Python 3.8-3.12). PP‑OCR, PaddleOCR‑VL 또는 PP‑StructureV3 문서를 위한 퀵스타트 링크를 따르세요.
  • 배포: 모델을 ONNX로 변환한 다음 OpenVINO, TensorRT로 가속화하거나 멀티 GPU 병렬 추론을 실행합니다. C++/C#/Java 서빙 레이어도 제공됩니다.

사용자

  • 6,000개 이상의 GitHub 프로젝트가 PaddleOCR에 의존하고 있습니다.
  • 상용 RAG 플랫폼(Dify, RAGFlow, Cherry Studio) 및 AI 에이전트 프레임워크에 통합되어 있습니다.
  • 고정밀 다국어 문서 디지털화가 필요한 기업에서 채택하고 있습니다.

요약 PaddleOCR은 가공되지 않은 시각적 데이터를 구조화된 LLM 친화적 형식으로 연결하는 성숙한 오픈 소스 OCR 및 문서 AI 엔진입니다. 모듈형 모델, 다국어 지원 및 유연한 배포 옵션 덕분에 문서를 읽고 이해해야 하는 AI 애플리케이션을 구축하는 모든 사용자에게 최적의 솔루션입니다.

관련

  • 프로젝트
  • Dispatch
  • 프로젝트
  • Dispatch
  • 프로젝트