mittagessen/kraken
OCR engine for all the languages
kraken란 무엇인가요?
kraken은 주류 OCR 엔진이 충분히 지원하지 못하는 역사적 문서 및 비라틴 문자를 디지털화하기 위해 목표로 한 오픈소스 OCR(광학 문자 인식) 툴킷입니다. 트레이너블한 레이아웃 분석기, 읽기 순서 탐지기, 오른쪽에서 왼쪽, 양방향, 상하 방향 텍스트를 처리할 수 있는 신경망 기반 인식기를 통합하고 있습니다.
주요 기능
| 기능 | 중요성 |
|---|---|
| 완전히 트레이너블한 파이프라인 – 새로운 페이지 레이아웃, 읽기 순서, 문자 집합을 시스템에 학습시킬 수 있으며, 고대 문헌, 비라틴 알파벳, 또는 사용자 정의 폰트 처리에 필수적입니다. | |
| 양방향 및 세로 글꼴 지원 – 아랍어, 히브리어, CJK 세로 텍스트 등과 같은 글꼴을 지원합니다. | |
| 다양한 출력 형식 – ALTO, PageXML, abbyyXML, hOCR 등은 디지털 도서관 워크플로우에 바로 통합할 수 있습니다. | |
| 단어 수준의 경계 상자 및 문자 자르기 – 학술적 주석에 유용한 세밀한 위치 정보 제공. | |
| Zenodo에 있는 모델 자료실 – 사전 학습된 모델(예: 인쇄체 프랑스어, 고대 폰트)의 공개 리포지토리로, 단일 명령어로 쉽게 가져올 수 있습니다. | |
| 플러그인 가능한 네트워크 아키텍처 – 속도나 정확도 요구에 따라 인식기의 백본을 교체할 수 있습니다. | |
| 크로스플랫폼 – Linux 및 macOS에서 x86_64 및 ARM CPU 모두에서 작동합니다. |
시작하기 (빠른 설치)
# 추천: pipx를 통한 격리 환경
sudo apt install pipx # Debian/Ubuntu에서
pipx install kraken # 패키지와 종속성 자동 다운로드
기존 가상 환경을 선호하는 경우:
python -m venv venv && source venv/bin/activate
pip install kraken # 또는 리포지토리에서 `pip install .`
PDF 또는 다중 이미지 TIFF 지원이 필요하면 선택적 확장을 추가합니다:
pip install kraken[pdf]
단일 명령어로 OCR 실행
kraken -i image.tif image.txt binarize segment ocr
이 명령어는 다음 세 가지 작업을 자동으로 수행합니다:
- 이미지 이진화 (nlbin 알고리즘).
- 텍스트 줄로 세그멘테이션 (베이스라인 세그멘터).
- 기본 모델을 사용해 텍스트 인식 후 평문 파일로 출력.
각 단계를 개별적으로 호출할 수도 있습니다 (예: kraken -i img.tif bw.png binarize).
사용자 모델로 확장하기
# 공개 Zenodo 컬렉션에서 미리 준비된 모델 가져오기
kraken get 10.5281/zenodo.10592716
# 사용 가능한 커뮤니티 모델 목록 보기
kraken list
커스텀 프로젝트의 경우, 자체 애노테이션 데이터로 새로운 모델을 학습할 수 있습니다 (https://kraken.re의 문서에서 전체 워크플로우를 확인할 수 있습니다).
누가 사용하고 있나요?
kraken은 École Pratique des Hautes Études, Université PSL에 소속된 eScripta 연구 그룹에서 개발되었으며, 훈련 데이터를 애노테이션하고 추론을 실행할 수 있는 GUI를 제공하는 eScriptorium 웹 인터페이스와 밀접하게 통합되어 있습니다. 여러 EU 연구 프로그램(Atrium, ERC MiDRASH, RESILIENCE, 프랑스 ANR Biblissima+)의 자금 지원을 받아, 디지털 인문학 및 문화유산 프로젝트에서의 중요성을 입증하고 있습니다.
더 알아보기
- 문서 사이트: https://kraken.re
- GitHub 리포지토리: https://github.com/mittagessen/kraken (테스트 스위트, 기여 가이드 포함)
- 커뮤니티 채팅: README에 링크된 Gitter 채널에서 eScriptorium 통합 관련 도움을 받을 수 있습니다.
TL;DR
kraken은 역사적 및 비라틴 문자에 특화된 Python 기반, 완전히 트레이너블한 OCR 엔진으로, 이진화 → 레이아웃 분석 → 인식의 엔드투엔드 처리를 제공하며, 오픈 모델 라이브러리를 보유하고 있습니다. pipx install kraken으로 설치하고, 모델을 가져온 후 kraken -i file.tif out.txt binarize segment ocr 명령어를 실행하여 오래된 텍스트의 디지털화를 시작하세요.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트