kha-white/manga-ocr
Optical character recognition for Japanese text, with the main focus being Japanese manga
What it solves
Manga OCR 提供高质量的光学字符识别(OCR),专门针对漫画中的日文文本进行优化。它解决了漫画 OCR 常见的挑战,如垂直和水平文字、振假名(小型注音标注)、覆盖在复杂图像上的文字、多样的字体样式以及低质量图像来源。
How it works
该项目使用自定义的端到端模型,基于 Transformers 的 Vision Encoder Decoder 框架构建。不同于传统 OCR 模型需要将文字拆分成行,Manga OCR 能在一次前向传播中识别多行文字,从而一次性处理整个文字气泡。
Who it’s for
它面向希望从漫画、小说或电子游戏中提取日文文本的用户。特别适用于使用 ShareX、Flameshot 等截图工具,并配合 Yomitan 等字典应用的阅读与挖掘工作流。
Highlights
- 基于 Vision Encoder Decoder 的自定义端到端模型
- 支持垂直和水平的日文文字
- 处理振假名和覆盖在图像上的文字
- 在单次传递中处理多行文字气泡
- 可在后台运行,处理剪贴板或特定文件夹中的图像