kha-white/manga-ocr

Optical character recognition for Japanese text, with the main focus being Japanese manga

What it solves

Manga OCR 提供高品質的光學字符辨識(OCR),專門針對漫畫中的日文文字進行最佳化。它解決了漫畫 OCR 常見的挑戰,包括垂直與水平文字、振假名(小型注音標示)、覆蓋在複雜圖像上的文字、多樣的字體樣式,以及低品質影像來源。

How it works

此專案使用自訂的端到端模型,建構於 Transformers 的 Vision Encoder Decoder 框架上。與傳統的 OCR 模型必須將文字切割成行不同,Manga OCR 能在一次前向傳播中辨識多行文字,因而一次處理整個文字氣泡。

Who it’s for

此工具適合想要從漫畫、小說或電玩中擷取日文文字的使用者。特別適用於使用 ShareX、Flameshot 等截圖工具,並搭配 Yomitan 等字典應用的閱讀與資料挖掘工作流程。

Highlights

  • 基於 Vision Encoder Decoder 的自訂端到端模型
  • 支援垂直與水平的日文文字
  • 能處理振假名與覆蓋在圖像上的文字
  • 在單一次傳遞中處理多行文字氣泡
  • 可在背景執行,處理剪貼簿或特定資料夾中的影像