scribeocr/scribeocr

Web interface for recognizing text, proofreading OCR, and creating fully-digitized documents.

해결하는 문제

Scribe OCR는 정확도가 낮거나 정렬이 잘못된 OCR(광학 문자 인식) 데이터의 문제를 해결하기 위해 설계되었습니다. 기존의 OCR 도구는 이미지 위에 대략적으로 위치한 '보이지 않는 텍스트' 레이어를 생성하지만, Scribe OCR은 고정밀 정렬과 효율적인 교정을 통해 OCR 정확도를 98%에서 100%로 끌어올립니다.

작동 방식

이 애플리케이션은 브라우저 내에서 완전히 실행되어 원격 서버로 데이터가 전송되지 않습니다. 텍스트 인식에는 Scribe.js 라이브러리를 사용합니다. 오류를 더 쉽게 확인할 수 있도록 각 문서마다 맞춤형 폰트를 생성하여 원본 스캔과 오버레이 텍스트 간의 정렬을 최적화합니다. 편집 가능한 텍스트가 소스 이미지 위에 정확히 겹쳐지는 전용 교정 모드를 제공하며, 신뢰도가 낮은 문자는 빨간색으로 강조하여 사용자를 안내합니다.

대상 사용자

원본 문서의 레이아웃을 이미지 배경 없이 정확히 재현하는 완전히 디지털화된 ebook 스타일 PDF를 만들고 싶은 사용자, 정확한 검색 가능한 PDF를 만들고 싶은 사용자, 또는 기존 OCR 데이터(예: Tesseract HOCR 파일 포함)를 교정하고 싶은 사용자에게 적합합니다.

주요 기능

  • 브라우저 기반 처리: 모든 인식 및 처리가 브라우저 내에서 로컬로 수행됩니다.
  • 폰트 최적화: 문서별 맞춤형 폰트를 생성하여 텍스트 정렬 및 오류 탐지 성능을 향상시킵니다.
  • ebook 모드: 소형 파일 크기의 텍스트 기반 PDF를 생성하며 원본 레이아웃을 정확히 재현합니다.
  • 유연한 내보내기: ebook 스타일 PDF와 전통적인 이미지 위에 텍스트가 있는 PDF 모두 지원합니다.
  • HOCR 지원: 다른 애플리케이션에서 생성한 OCR 데이터를 편집하고 수정할 수 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트