kha-white/manga-ocr

Optical character recognition for Japanese text, with the main focus being Japanese manga

What it solves

Manga OCR は、漫画中の日本語テキストに特化した高品質な光学文字認識(OCR)を提供します。縦書き・横書きの文字、振り仮名(小さなふりがな)、複雑な画像上に重なる文字、さまざまなフォントスタイル、低品質な画像ソースといった、漫画 OCR が直面する一般的な課題に対応します。

How it works

本プロジェクトは、Transformers の Vision Encoder Decoder フレームワークを用いて構築したカスタムのエンドツーエンドモデルを使用しています。従来の OCR モデルがテキストを行単位に分割するのとは異なり、Manga OCR は単一のフォワードパスで複数行テキストを認識でき、テキストバブル全体を一度に処理できます。

Who it’s for

漫画、小説、ビデオゲームから日本語テキストを抽出したいユーザー向けです。特に、ShareX、Flameshot といったスクリーンショットツールや、Yomitan のような辞書アプリを組み合わせた読み取り・マイニングワークフローを利用する方に有用です。

Highlights

  • Vision Encoder Decoder に基づく独自のエンドツーエンドモデル
  • 縦書き・横書きの日本語テキストをサポート
  • 振り仮名や画像上に重なるテキストを処理
  • 単一パスで複数行テキストバブルを処理
  • クリップボードや特定フォルダーからの画像をバックグラウンドで処理可能