aiptimizer/TurboOCR
TurboOCR, >200 img/s OmnidocBench. TensorRT FP16, PP-OCRv6, HTTP + gRPC
What it solves
TurboOCR은 고성능 GPU 가속 문서 파서로, 느린 기존 OCR 엔진과 무거운 Vision Language Model(VLM)을 대체하도록 설계되었습니다. 텍스트, 레이아웃, 표, 수학 수식 등 문서에서 구조화된 데이터를 극한 속도로 추출하면서 완전 로컬 및 프라이버시를 보장합니다.
How it works
C++, CUDA, TensorRT로 구축되었으며, PP-OCRv6 기반의 멀티스트림 파이프라인을 구현합니다. 단일 모놀리식 대신 다음과 같은 전문 모델 스택을 사용합니다:
- Text Detection & Recognition: PP-OCRv6(티니, 스몰, 미디엄 티어)으로 라틴어, 중국어, 일본어 스크립트를 처리합니다.
- Layout Analysis: PP-DocLayoutV3를 이용해 25가지 문서 클래스를 식별하고 읽기 순서를 결정합니다.
- Table Extraction: SLANet-Plus를 사용해 표를 HTML로 변환합니다.
- Formula Recognition: PP-FormulaNet‑S를 사용해 수학 수식을 LaTeX로 변환합니다.
시스템은 서버 형태로 배포되며 HTTP와 gRPC API를 모두 제공합니다. TensorRT 엔진은 첫 시작 시 자동으로 빌드되어 사용 중인 NVIDIA GPU에 최적화된 성능을 제공합니다.
Who it’s for
초당 수천 건의 영수증이나 양식을 처리해야 하는 개발자 및 조직을 위한 솔루션입니다. 최신 OCR의 정확도는 필요하지만 VLM 기반 파서의 지연이나 비용을 감당할 수 없는 경우에 적합합니다.
Highlights
- Extreme Throughput: RTX 5090에서 초당 최대 559장의 이미지(영수증)를 처리할 수 있습니다.
- Structured Output: Markdown, HTML(표용), LaTeX(수식용)으로 내보내기를 지원합니다.
- Native PDF Support: PDF 페이지를 병렬로 렌더링하고 OCR하며, 자동 회전 옵션을 제공합니다.
- Flexible Deployment: 한 줄 Docker 명령으로 배포 가능하고, 내장 Prometheus 메트릭으로 모니터링합니다.
- Multi-Language Support: 라틴어, 중국어, 일본어는 물론 아랍어, 키릴어, 한국어, 태국어, 그리스어 등 다양한 스크립트를 지원합니다.