datalab-to/surya

OCR, layout analysis, reading order, table recognition in 90+ languages

해결하는 문제

Surya는 고정밀 다국어 OCR(광학 문자 인식) 및 문서 지능 도구입니다. 표, 수식, 다양한 레이아웃을 포함한 복잡한 문서를 91개 언어를 지원하는 구조화된 기계 가독성 텍스트 및 HTML로 변환하는 문제를 해결합니다.

작동 방식

Surya는 650M 파라미터의 비전 언어 모델(VLM)을 사용하여 레이아웃 분석, 텍스트 인식, 테이블 인식을 수행합니다. vllm을 사용해 NVIDIA GPU용 백엔드 서버를 자동으로 생성하거나, llama.cpp를 사용해 CPU 및 Apple Silicon용 백엔드 서버를 구동할 수 있습니다. 시스템은 전체 페이지 또는 특정 텍스트 블록을 처리할 수 있으며, KaTeX 호환 LaTeX를 포함한 HTML로 변환하고, 모든 요소에 대해 정확한 경계 상자(Bounding Box)를 제공합니다.

대상 사용자

PDF, 이미지, 스캔 문서에서 구조화된 데이터를 추출해야 하는 개발자 및 연구자에게 적합합니다. 특히 교과서, 세금 신고서, 기업 문서와 같은 복잡한 포맷을 포함한 문서를 다룰 때 유용합니다.

주요 기능

  • 다국어 지원: 91개 언어에서 높은 정확도를 제공합니다.
  • 문서 지능: 헤더, 푸터, 캡션 등의 레이아웃 분석 및 읽기 순서 탐지 기능을 수행합니다.
  • 테이블 인식: 테이블 구조(행과 열)를 추출하고, 전체 HTML 테이블로 출력할 수 있습니다.
  • 수식 지원: 인라인 수식을 인식하고 KaTeX 호환 LaTeX 형식으로 출력합니다.
  • 유연한 추론: GPU(기반: vllm) 및 CPU/Apple Silicon(기반: llama.cpp) 백엔드를 모두 지원합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트