kha-white/manga-ocr
Optical character recognition for Japanese text, with the main focus being Japanese manga
What it solves
Manga OCR は、漫画中の日本語テキストに特化した高品質な光学文字認識(OCR)を提供します。縦書き・横書きの文字、振り仮名(小さなふりがな)、複雑な画像上に重なる文字、さまざまなフォントスタイル、低品質な画像ソースといった、漫画 OCR が直面する一般的な課題に対応します。
How it works
本プロジェクトは、Transformers の Vision Encoder Decoder フレームワークを用いて構築したカスタムのエンドツーエンドモデルを使用しています。従来の OCR モデルがテキストを行単位に分割するのとは異なり、Manga OCR は単一のフォワードパスで複数行テキストを認識でき、テキストバブル全体を一度に処理できます。
Who it’s for
漫画、小説、ビデオゲームから日本語テキストを抽出したいユーザー向けです。特に、ShareX、Flameshot といったスクリーンショットツールや、Yomitan のような辞書アプリを組み合わせた読み取り・マイニングワークフローを利用する方に有用です。
Highlights
- Vision Encoder Decoder に基づく独自のエンドツーエンドモデル
- 縦書き・横書きの日本語テキストをサポート
- 振り仮名や画像上に重なるテキストを処理
- 単一パスで複数行テキストバブルを処理
- クリップボードや特定フォルダーからの画像をバックグラウンドで処理可能