PaddlePaddle/PaddleOCR
Turn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100+ languages.
What it solves
PaddleOCR은 PDF 문서와 이미지를 구조화된 기계 판독 가능한 데이터(JSON 및 Markdown 등)로 변환하기 위해 설계된 종합 툴킷입니다. 자연 장면, 고대 문서, 산업 부품 등 복잡한 시각 레이아웃에서 텍스트, 표, 수식, 차트를 추출하는 문제를 해결하여 이러한 데이터를 "LLM‑ready" 상태로 만들어 RAG(Retrieval‑Augmented Generation) 및 AI 에이전트 애플리케이션에 활용할 수 있게 합니다.
How it works
이 프로젝트는 다양한 OCR 작업을 처리하기 위한 여러 특화 모델 시리즈를 제공합니다:
- PaddleOCR-VL: 동적 해상도 비주얼 인코더와 언어 모델을 통합한 경량 비전‑언어 모델(VLM)로, 페이지 수준 문서 파싱 및 요소 인식을 수행합니다.
- PP-OCR: 고속 다국어 텍스트 스포팅 시스템(현재 v6)으로, 100개 이상의 언어를 지원하며 서버와 엣지(tiny, small, medium) 배포에 최적화되어 있습니다.
- PP-StructureV3: 구조 인식 변환 엔진으로, 복잡한 PDF와 이미지를 Markdown 또는 JSON으로 변환하고 표 셀 및 텍스트에 대한 세밀한 좌표 정보를 제공합니다.
Who it’s for
AI 에이전트, RAG 파이프라인 및 문서 AI 엔진을 구축하는 개발자를 위해 설계되었으며, 비구조화된 시각 데이터를 고품질 구조화 텍스트로 변환해야 하는 경우에 적합합니다. 또한 NVIDIA GPU, Intel CPU, 모바일 디바이스 등 다양한 하드웨어에 OCR을 배포하는 엔지니어에게도 유용합니다.
Highlights
- Multilingual Mastery: 100개 이상의 언어를 통합 모델로 지원하여 모델 전환 필요성을 감소시킵니다.
- LLM-Ready Output: Markdown 및 JSON으로 직접 내보내어 LLM과의 원활한 통합을 촉진합니다.
- High Efficiency: 초소형 모델 풋프린트(예: PP‑OCRv6 tiny는 1.5M 파라미터)를 제공하며 CPU와 GPU 추론 속도를 크게 향상시킵니다.
- Broad Hardware Support: OpenVINO, ONNX Runtime, TensorRT 및 다양한 AI 가속기 등 다양한 백엔드를 지원합니다.
- C++ and JS Support: C++ 로컬 배포 솔루션과 브라우저 기반 추론 SDK(
PaddleOCR.js)를 포함합니다.