tesseract-ocr/tesseract

Tesseract Open Source OCR Engine (main repository)

What it solves

텍스트 이미지를 기계 판독 가능한 텍스트로 변환하는 방법, 즉 광학 문자 인식(OCR) 프로세스를 제공합니다. 이를 통해 사용자는 다양한 이미지 형식에서 텍스트를를 추출하여 plain text, PDF, 또는 HTML과 같은 형식으로 출력할 수 있습니다.

How it works

Tesseract는 두 가지 다른 OCR 엔진을 사용합니다: 행 인식을 위한 Long Short-Term Memory (LSTM) 기반의 현대적인 신경망과, 개별 문자 패턴을 인식하는 레거시 엔진입니다. PNG, JPEG, 및 TIFF와 같은 입력 이미지를 처리하고, 훈련된 데이터 파일을 사용하여 100개 이상의 서로 다른 언어를 인식합니다.

Who it's for

텍스트 추출을 위한 명령줄 도구가 필요한 최종 사용자뿐만 아니라, libtesseract C/C++ API를 통해 자신의 애플리케이션에 OCR 기능을 통합하고자 하는 개발자들을 위해 설계되었습니다.

Highlights

  • 100개 이상의 언어를 즉시 지원합니다.
  • plain text, hOCR, PDF, TSV, ALTO, 및 PAGE를 포함한 다양한 출력 형식 제공.
  • Unicode (UTF-8)를 지원합니다.
  • 새로운 언어를 인식하도록 훈련할 수 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트