PP-OCRv6 릴리스: 1.5M에서 34.5M 파라미터까지 50개 언어 OCR
PP-OCRv6 릴리스: 1.5M에서 34.5M 파라미터까지 50개 언어 OCR
PaddlePaddle은 최신 세대의 PaddleOCR 범용 모델 패밀리인 PP-OCRv6을 출시했습니다. 이 모델은 다양한 실제 상황에서 높은 정확도의 텍스트 감지 및 인식을 위해 설계되었습니다. 이번 릴리스는 문서, 스크린샷, 다국어 이미지 및 산업 라벨에 대한 확장 가능한 솔루션을 제공하며, 정확도와 연산 효율성을 균형 있게 맞추기 위해 세 가지 모델 티어를 제공합니다.
확장 가능한 모델 티어 및 성능
PP-OCRv6은 엣지 디바이스부터 고성능 서버까지 다양한 배포 제약을 수용하기 위해 세 가지 티어로 구성됩니다. 중간 티어는 86.2% 감지 Hmean과 83.2% 인식 정확도를 달성하여 이전 PP-OCRv5_server 모델에 비해 크게 향상되었습니다(감지에서 +4.6 포인트, 인식에서 +5.1 포인트).
| 모델 | 모델 크기 | 감지 Hmean | 인식 정확도 | 일반적인 적용 시나리오 |
|---|---|---|---|---|
| PP-OCRv6_tiny | 1.5M params | 80.6% | 73.5% | 엣지 디바이스, 경량 로컬 OCR, 지연에 민감한 데모, 제한된 환경 |
| PP-OCRv6_small | 7.7M params | 84.1% | 81.3% | 모바일, 데스크톱, 균형 잡힌 OCR 서비스, 낮은 연산 비용의 다국어 OCR |
| PP-OCRv6_medium | 34.5M params | 86.2% | 83.2% | 정확도 중심 OCR, 서버 측 파이프라인, 산업 OCR, 문서 수집, 다국어 OCR |
아키텍처 개선
PP-OCRv6은 복잡하고 실제 입력에 대한 성능을 향상시키기 위해 OCR 파이프라인의 감지 및 인식 단계 모두에 특정 아키텍처 업데이트를 도입합니다.
통합 백본
모델 패밀리는 PPLCNetV4를 텍스트 감지와 텍스트 인식 모두에 대한 통합 백본으로 활용합니다. 이는 tiny, small, medium 티어 전반에 걸쳐 아키텍처 일관성을 제공합니다.
RepLKFPN을 활용한 향상된 텍스트 감지
작고 밀집되거나 회전된 텍스트와 같은 문제를 해결하기 위해 감지 모듈이 RepLKFPN으로 업그레이드되었습니다. 이는 추론 효율성을 유지하면서 다중 스케일 텍스트 감지를 개선하도록 설계된 경량 대형 커널 피처 피라미드 네트워크입니다.
EncoderWithLightSVTR을 활용한 향상된 인식
인식 단계에서는 PP-OCRv6이 EncoderWithLightSVTR을 사용합니다. 이 아키텍처는 로컬 컨텍스트 모델링과 글로벌 어텐션을 결합하여 다국어 텍스트, 화면 텍스트, 노이즈가 많은 이미지 영역 등 어려운 텍스트 영역에 대한 인식 품질을 향상시킵니다.
다국어 지원 및 배포
PP-OCRv6은 small 및 medium 티어 내에서 통합된 다국어 지원을 제공합니다. 이 모델들은 50개 언어를 지원하며, 간체 중국어, 번체 중국어, 영어, 일본어 및 46개의 라틴 문자 기반 언어를 포함하여 다수의 특화된 모델이 필요하지 않게 합니다.
추론 백엔드
개발자는 PaddleOCR 라이브러리를 통해 여러 추론 백엔드를 사용하여 PP-OCRv6을 통합할 수 있습니다:
- Transformers: Hugging Face / PyTorch 기반 추론 경로.
- ONNX Runtime: ONNX 기반 배포 환경을 위한 포터블 경로.
- Paddle Inference: Paddle 고유의 추론 포맷.
모델 자산은 Hugging Face Hub에서 여러 형식으로 제공되며, safetensors, Paddle inference models, ONNX models 등을 포함합니다.