PaddlePaddle/PaddleOCR
Turn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100+ languages.
PaddleOCR – 프로덕션급 OCR 및 문서 AI 툴킷
주요 기능
- 이미지 또는 PDF를 기계 판독 가능한 텍스트, 표, 수식 및 전체 문서 구조로 변환합니다.
- 출력물은 레이아웃 정보를 보존하는 JSON 또는 Markdown 형식으로, 대규모 언어 모델(LLM)에 즉시 사용 가능합니다.
- 전통적인 OCR(텍스트 탐지 및 인식)과 복잡한 문서를 위한 고급 비전-언어 파싱을 모두 지원합니다.
핵심 구성 요소
| 구성 요소 | 목적 | 주요 특징 |
|---|---|---|
| PP‑OCRv6 | 범용 장면 텍스트 탐지 | 단일 모델로 100개 이상의 언어 지원, v5 대비 탐지 +4.6% 및 인식 +5.1% 향상, CPU에서 5.2배 빠름, 엣지-서버 배포를 위한 tiny (1.5M) – medium (34.5M) 모델 크기 |
| PaddleOCR‑VL‑1.6 | 문서 파싱을 위한 경량 비전-언어 모델 | 0.9B 파라미터, OmniDocBench v1.6에서 96.3% 정확도, 표, 수식, 고대 문자, 인장에 탁월; 요소 좌표가 포함된 Markdown/JSON 출력 |
| PP‑StructureV3 | PDF/이미지의 구조적 변환 | 세밀한 레이아웃(셀 좌표, 제목, 페이지 간 표) 생성 및 DOCX, Markdown, JSON으로 내보내기 가능 |
| HPD‑Parsing (2026‑07‑22) | 고처리량 문서 파싱 | 계층적 병렬 디코딩, 4,752 tokens/s, OpenAI 스타일 서빙 또는 로컬 vLLM 런타임과 호환 |
AI/LLM 파이프라인에 중요한 이유
- LLM 친화적 데이터: 이 툴킷은 검색 증강 생성(RAG) 또는 에이전트 시스템에 꼭 필요한 깨끗하고 구조화된 텍스트와 위치 메타데이터를 제공합니다.
- 속도 및 크기: 모델은 몇 메가바이트(엣지)에서 약 35M 파라미터(서버)까지 다양하며 CPU, GPU, XPU, NPU 또는 ONNX/TensorRT를 통해 실행할 수 있어 클라우드 서비스나 온디바이스 앱에 통합하기 쉽습니다.
- 생태계 연결: 인기 있는 RAG 플랫폼(Dify, RAGFlow, Pathway, Cherry Studio) 및 브라우저 SDK (
PaddleOCR.js)와의 사전 구축된 통합을 제공합니다.
일반적인 워크플로우
- 입력 – 이미지, 스캔된 PDF 또는 실시간 카메라 프레임을 제공합니다.
- 파이프라인 선택 – 모델 제품군을 선택합니다:
- 빠른 다국어 텍스트 탐지를 위한 PP‑OCRv6.
- 레이아웃 인지 변환을 위한 PP‑StructureV3.
- 표, 수식 또는 고대 문자가 필요한 경우 심층 VLM 기반 파싱을 위한 PaddleOCR‑VL.
- 추론 – 로컬(Python, C++, Java 등) 또는 호스팅된 API를 통해 실행합니다. 백엔드는 Paddle static/dynamic graph, Transformers, ONNX Runtime, OpenVINO, TensorRT 등을 지원합니다.
- 출력 – 텍스트 문자열, 경계 상자(bounding boxes), 표 구조 및 선택적 DOCX 파일이 포함된 JSON/Markdown을 받습니다.
- 다운스트림 – 구조화된 출력을 요약, 질의응답, 지식 베이스 구축을 위해 LLM에 전달하거나 검색을 위해 RAG 엔진에 전달합니다.
시작하기
- 온라인 데모: 설치가 필요 없습니다. https://www.paddleocr.com 의 Experience Center를 이용해 보세요.
- 로컬 설치:
pip install paddleocr(Python 3.8-3.12). PP‑OCR, PaddleOCR‑VL 또는 PP‑StructureV3 문서를 위한 퀵스타트 링크를 따르세요. - 배포: 모델을 ONNX로 변환한 다음 OpenVINO, TensorRT로 가속화하거나 멀티 GPU 병렬 추론을 실행합니다. C++/C#/Java 서빙 레이어도 제공됩니다.
사용자
- 6,000개 이상의 GitHub 프로젝트가 PaddleOCR에 의존하고 있습니다.
- 상용 RAG 플랫폼(Dify, RAGFlow, Cherry Studio) 및 AI 에이전트 프레임워크에 통합되어 있습니다.
- 고정밀 다국어 문서 디지털화가 필요한 기업에서 채택하고 있습니다.
요약 PaddleOCR은 가공되지 않은 시각적 데이터를 구조화된 LLM 친화적 형식으로 연결하는 성숙한 오픈 소스 OCR 및 문서 AI 엔진입니다. 모듈형 모델, 다국어 지원 및 유연한 배포 옵션 덕분에 문서를 읽고 이해해야 하는 AI 애플리케이션을 구축하는 모든 사용자에게 최적의 솔루션입니다.
관련
- 프로젝트
- Dispatch
- 프로젝트
- Dispatch
- 프로젝트