mittagessen/kraken

OCR engine for all the languages

kraken란 무엇인가요?

kraken은 주류 OCR 엔진이 충분히 지원하지 못하는 역사적 문서 및 비라틴 문자를 디지털화하기 위해 목표로 한 오픈소스 OCR(광학 문자 인식) 툴킷입니다. 트레이너블한 레이아웃 분석기, 읽기 순서 탐지기, 오른쪽에서 왼쪽, 양방향, 상하 방향 텍스트를 처리할 수 있는 신경망 기반 인식기를 통합하고 있습니다.


주요 기능

기능 중요성
완전히 트레이너블한 파이프라인 – 새로운 페이지 레이아웃, 읽기 순서, 문자 집합을 시스템에 학습시킬 수 있으며, 고대 문헌, 비라틴 알파벳, 또는 사용자 정의 폰트 처리에 필수적입니다.
양방향 및 세로 글꼴 지원 – 아랍어, 히브리어, CJK 세로 텍스트 등과 같은 글꼴을 지원합니다.
다양한 출력 형식 – ALTO, PageXML, abbyyXML, hOCR 등은 디지털 도서관 워크플로우에 바로 통합할 수 있습니다.
단어 수준의 경계 상자 및 문자 자르기 – 학술적 주석에 유용한 세밀한 위치 정보 제공.
Zenodo에 있는 모델 자료실 – 사전 학습된 모델(예: 인쇄체 프랑스어, 고대 폰트)의 공개 리포지토리로, 단일 명령어로 쉽게 가져올 수 있습니다.
플러그인 가능한 네트워크 아키텍처 – 속도나 정확도 요구에 따라 인식기의 백본을 교체할 수 있습니다.
크로스플랫폼 – Linux 및 macOS에서 x86_64 및 ARM CPU 모두에서 작동합니다.

시작하기 (빠른 설치)

# 추천: pipx를 통한 격리 환경
sudo apt install pipx            # Debian/Ubuntu에서
pipx install kraken               # 패키지와 종속성 자동 다운로드

기존 가상 환경을 선호하는 경우:

python -m venv venv && source venv/bin/activate
pip install kraken               # 또는 리포지토리에서 `pip install .`

PDF 또는 다중 이미지 TIFF 지원이 필요하면 선택적 확장을 추가합니다:

pip install kraken[pdf]

단일 명령어로 OCR 실행

kraken -i image.tif image.txt binarize segment ocr

이 명령어는 다음 세 가지 작업을 자동으로 수행합니다:

  1. 이미지 이진화 (nlbin 알고리즘).
  2. 텍스트 줄로 세그멘테이션 (베이스라인 세그멘터).
  3. 기본 모델을 사용해 텍스트 인식 후 평문 파일로 출력.

각 단계를 개별적으로 호출할 수도 있습니다 (예: kraken -i img.tif bw.png binarize).


사용자 모델로 확장하기

# 공개 Zenodo 컬렉션에서 미리 준비된 모델 가져오기
kraken get 10.5281/zenodo.10592716

# 사용 가능한 커뮤니티 모델 목록 보기
kraken list

커스텀 프로젝트의 경우, 자체 애노테이션 데이터로 새로운 모델을 학습할 수 있습니다 (https://kraken.re의 문서에서 전체 워크플로우를 확인할 수 있습니다).


누가 사용하고 있나요?

kraken은 École Pratique des Hautes Études, Université PSL에 소속된 eScripta 연구 그룹에서 개발되었으며, 훈련 데이터를 애노테이션하고 추론을 실행할 수 있는 GUI를 제공하는 eScriptorium 웹 인터페이스와 밀접하게 통합되어 있습니다. 여러 EU 연구 프로그램(Atrium, ERC MiDRASH, RESILIENCE, 프랑스 ANR Biblissima+)의 자금 지원을 받아, 디지털 인문학 및 문화유산 프로젝트에서의 중요성을 입증하고 있습니다.


더 알아보기


TL;DR

kraken은 역사적 및 비라틴 문자에 특화된 Python 기반, 완전히 트레이너블한 OCR 엔진으로, 이진화 → 레이아웃 분석 → 인식의 엔드투엔드 처리를 제공하며, 오픈 모델 라이브러리를 보유하고 있습니다. pipx install kraken으로 설치하고, 모델을 가져온 후 kraken -i file.tif out.txt binarize segment ocr 명령어를 실행하여 오래된 텍스트의 디지털화를 시작하세요.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트