OCR4all/OCR4all
Provides OCR (Optical Character Recognition) services through web applications
해결 과제
OCR4all은 역사적 인쇄물에 대해 광학 문자 인식(OCR)을 수행하기 위한 반자동 워크플로우를 제공합니다. 기술적 배경지식이 없는 사용자도 표준 OCR 도구로는 처리하기 어려운 초기 간행물에서 고품질의 텍스트 인식 결과를 얻을 수 있도록 설계되었습니다.
작동 방식
이 프로젝트는 문서 분석 및 텍스트 인식을 위한 여러 전문 도구를 통합하고 있으며, 여기에는 OCRopus, Calamari 및 레이아웃 분석을 위한 LAREX가 포함됩니다. 워크플로우를 관리하기 위한 메인 인터페이스와 서버를 제공하여, 자동화가 실패할 경우 수동으로 개입하여 결과를 수정하고 정확도를 높일 수 있습니다.
대상 사용자
역사적 문서와 초기 간행물을 디지털 텍스트로 변환해야 하는 연구자, 역사학자 및 기술적 배경이 없는 사용자.
주요 특징
- 수동 수정 및 상호 작용이 가능한 반자동 워크플로우.
- 역사적 인쇄물 및 초기 간행물에 최적화.
- 다수의 OCR 엔진 및 문서 분석 프로그램 통합.
- 설치 편의를 위해 사전 구성된 Docker 이미지로 제공.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트