kha-white/manga-ocr
Optical character recognition for Japanese text, with the main focus being Japanese manga
What it solves
Manga OCR은 만화에 등장하는 일본어 텍스트에 특화된 고품질 광학 문자 인식(OCR)을 제공합니다. 세로 및 가로 텍스트, 후리가나(작은 발음 안내), 복잡한 이미지 위에 겹쳐진 텍스트, 다양한 글꼴 스타일, 저품질 이미지 소스 등 만화 OCR이 흔히 겪는 문제들을 해결합니다.
How it works
이 프로젝트는 Transformers의 Vision Encoder Decoder 프레임워크를 사용해 만든 맞춤형 엔드‑투‑엔드 모델을 활용합니다. 기존 OCR 모델이 텍스트를 라인별로 나누는 것과 달리, Manga OCR은 한 번의 포워드 패스로 다중 라인 텍스트를 인식해 텍스트 버블 전체를 한 번에 처리할 수 있습니다.
Who it’s for
만화, 소설, 비디오 게임 등에서 일본어 텍스트를 추출하고자 하는 사용자에게 적합합니다. 특히 ShareX, Flameshot 같은 스크린샷 도구와 Yomitan 같은 사전 앱을 활용한 읽기·마이닝 워크플로우를 사용하는 경우에 유용합니다.
Highlights
- Vision Encoder Decoder 기반 자체 커스텀 엔드‑투‑엔드 모델
- 세로·가로 일본어 텍스트 모두 지원
- 후리가나 및 이미지 위에 겹친 텍스트 처리
- 단일 패스로 다중 라인 텍스트 버블 처리
- 클립보드 또는 지정 폴더의 이미지를 백그라운드에서 처리 가능