ndl-lab/ndlocr-lite

NDLOCR-Liteアプリケーションのリポジトリ(ソースコードを含む)NDLOCR‑Lite application repository (including source code)

解決的問題

NDLOCR-Lite 提供了一種輕量級的光學字元辨識(OCR)解決方案,用於數位化書籍與雜誌。專為在一般家用電腦(筆電)與常見作業系統上運行而設計,無需 GPU,即可快速從檔案資料的數位影像中提取文字。

工作原理

系統結合三個主要模組,將影像轉換為文字:

  1. 版面辨識:使用 DEIMv2 來識別文件的結構。
  2. 文字辨識:使用 PARSeq 來辨識實際字元。
  3. 閱讀順序排序:將辨識出的文字依正確順序排列。

模型使用 PyTorch 訓練,再轉換為 ONNX 格式以實現高效執行。應用程式可透過桌面 GUI(支援 Windows、Mac 與 Linux)或使用 Python 的命令列介面(CLI)使用。

適用對象

適合需要從影像中數位化印刷體或手寫日文文字,但缺乏高階硬體(如專用 GPU)或偏好使用簡單桌面應用程式進行檔案工作的使用者。

主要特色

  • 硬體高效:專為在一般 CPU 上快速運行而設計,無需 GPU。
  • 多平台相容:支援 Windows 11、macOS(含 Apple M4)與 Ubuntu 22.04。
  • 輸入格式多元:支援 JPG、PNG、TIFF、JP2、BMP 與 WebP 等多種影像格式。
  • 手寫支援:v1.2 版起增強手寫字元辨識能力。
  • 輸出彈性:可輸出 XML 或 JSON 格式結果。

相關

  • 專案
  • 專案
  • 專案
  • 專案