ndl-lab/ndlocr-lite
NDLOCR-Liteアプリケーションのリポジトリ(ソースコードを含む)NDLOCR‑Lite application repository (including source code)
解决的问题
NDLOCR-Lite 为数字化书籍和杂志提供了一种轻量级的光学字符识别(OCR)解决方案。它专为在标准家用电脑(笔记本电脑)和常见操作系统上运行而设计,无需 GPU,即可实现从档案资料的数字图像中快速提取文本。
工作原理
该系统结合了三个主要模块,将图像转换为文本:
- 布局识别:使用 DEIMv2 识别文档的结构。
- 文字识别:使用 PARSeq 识别实际字符。
- 阅读顺序排序:将识别出的文本按正确顺序排列。
模型使用 PyTorch 训练,然后转换为 ONNX 格式以实现高效执行。应用程序可通过桌面 GUI(支持 Windows、Mac 和 Linux)或使用 Python 的命令行接口(CLI)使用。
适用人群
适用于需要从图像中数字化印刷体或手写日文文本,但缺乏高端硬件(如专用 GPU)的用户,或偏好使用简单桌面应用程序进行档案工作的用户。
主要亮点
- 硬件高效:专为在通用 CPU 上快速运行而设计,无需 GPU。
- 多平台支持:兼容 Windows 11、macOS(包括 Apple M4)和 Ubuntu 22.04。
- 输入格式多样:支持 JPG、PNG、TIFF、JP2、BMP 和 WebP 等多种图像格式。
- 手写支持:v1.2 版起增强对手写字符的识别能力。
- 输出灵活:可输出 XML 或 JSON 格式的结果。
相关
- 项目
- 项目
- 项目
- 项目