ndl-lab/ndlocr-lite

NDLOCR-Liteアプリケーションのリポジトリ(ソースコードを含む)NDLOCR‑Lite application repository (including source code)

解决的问题

NDLOCR-Lite 为数字化书籍和杂志提供了一种轻量级的光学字符识别(OCR)解决方案。它专为在标准家用电脑(笔记本电脑)和常见操作系统上运行而设计,无需 GPU,即可实现从档案资料的数字图像中快速提取文本。

工作原理

该系统结合了三个主要模块,将图像转换为文本:

  1. 布局识别:使用 DEIMv2 识别文档的结构。
  2. 文字识别:使用 PARSeq 识别实际字符。
  3. 阅读顺序排序:将识别出的文本按正确顺序排列。

模型使用 PyTorch 训练,然后转换为 ONNX 格式以实现高效执行。应用程序可通过桌面 GUI(支持 Windows、Mac 和 Linux)或使用 Python 的命令行接口(CLI)使用。

适用人群

适用于需要从图像中数字化印刷体或手写日文文本,但缺乏高端硬件(如专用 GPU)的用户,或偏好使用简单桌面应用程序进行档案工作的用户。

主要亮点

  • 硬件高效:专为在通用 CPU 上快速运行而设计,无需 GPU。
  • 多平台支持:兼容 Windows 11、macOS(包括 Apple M4)和 Ubuntu 22.04。
  • 输入格式多样:支持 JPG、PNG、TIFF、JP2、BMP 和 WebP 等多种图像格式。
  • 手写支持:v1.2 版起增强对手写字符的识别能力。
  • 输出灵活:可输出 XML 或 JSON 格式的结果。

相关

  • 项目
  • 项目
  • 项目
  • 项目