kha-white/manga-ocr

Optical character recognition for Japanese text, with the main focus being Japanese manga

What it solves

Manga OCR 提供高质量的光学字符识别(OCR),专门针对漫画中的日文文本进行优化。它解决了漫画 OCR 常见的挑战,如垂直和水平文字、振假名(小型注音标注)、覆盖在复杂图像上的文字、多样的字体样式以及低质量图像来源。

How it works

该项目使用自定义的端到端模型,基于 Transformers 的 Vision Encoder Decoder 框架构建。不同于传统 OCR 模型需要将文字拆分成行,Manga OCR 能在一次前向传播中识别多行文字,从而一次性处理整个文字气泡。

Who it’s for

它面向希望从漫画、小说或电子游戏中提取日文文本的用户。特别适用于使用 ShareX、Flameshot 等截图工具,并配合 Yomitan 等字典应用的阅读与挖掘工作流。

Highlights

  • 基于 Vision Encoder Decoder 的自定义端到端模型
  • 支持垂直和水平的日文文字
  • 处理振假名和覆盖在图像上的文字
  • 在单次传递中处理多行文字气泡
  • 可在后台运行,处理剪贴板或特定文件夹中的图像