aiptimizer/TurboOCR

TurboOCR, >200 img/s OmnidocBench. TensorRT FP16, PP-OCRv6, HTTP + gRPC

해결하는 문제

TurboOCR는 이미지와 PDF를 구조화된 Markdown으로 변환하기 위한 고성능 GPU 가속 문서 파서입니다. 기존 OCR 및 VLM(Vision Language Model) 파서의 속도 한계를 해결하여, 단일 GPU에서 초당 수백 장의 이미지를 처리하면서도 양식, 영수증, 밀도 높은 문서에 대해 높은 정확도를 유지할 수 있습니다.

작동 방식

C++, CUDA, TensorRT로 구현된 이 프로젝트는 단일 모듈이 아닌 전용 모델의 파이프라인을 실행하는 다중 스트림 엔진을 사용합니다. 텍스트 검출 및 인식에는 PP-OCRv6, 레이아웃 분석에는 PP-DocLayoutV3를 사용하며, 표는 SLANet-Plus(HTML로 변환), 수학 공식은 PP-FormulaNet-S(LaTeX로 변환)와 같은 전용 모델을 활용합니다. 시스템은 서버 형태로 배포되어 HTTP 및 gRPC API를 제공하며, 첫 실행 시 특정 GPU 하드웨어에 최적화된 TensorRT 엔진을 자동으로 빌드합니다.

대상 사용자

산업 규모의 문서 디지털화가 필요한 개발자 및 조직을 위한 것입니다. 특히 영수증, 양식, 학술 논문을 대량으로 처리해야 하며, 낮은 지연 시간과 높은 처리량이 중요한 경우에 적합합니다.

주요 특징

  • 극한의 처리량: RTX 5090에서 영수증 처리 시 초당 최대 559장의 이미지를 처리할 수 있습니다.
  • 구조화된 출력: 단순 텍스트 추출을 넘어서 레이아웃 분석, 독서 순서, HTML 표, LaTeX 수식을 제공합니다.
  • 유연한 정확도 레벨: 속도와 정확도를 조절할 수 있는 tiny, small, medium 모델 레벨을 제공합니다.
  • 네이티브 PDF 지원: PDF 페이지를 병렬로 렌더링하고 OCR하며, 선택적으로 자동 회전 기능을 제공합니다.
  • 광범위한 언어 지원: 기본적으로 라틴어, 중국어, 일본어를 지원하며, 아랍어, 츄리트 문자, 한국어, 태국어, 그리스어도 추가 지원합니다.

관련

  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트