ndl-lab/ndlocr-lite

NDLOCR-Liteアプリケーションのリポジトリ(ソースコードを含む)NDLOCR‑Lite application repository (including source code)

何を解決するか

NDLOCR-Lite は、デジタル化された本や雑誌からテキストを抽出するための軽量な光学文字認識(OCR)ソリューションを提供します。標準的な家庭用コンピュータ(ノートPC)や一般的なオペレーティングシステムでGPUを必要とせずに動作するように設計されており、アーカイブ資料のデジタル画像から高速にテキストを抽出できます。

動作方法

システムは画像をテキストに変換するための3つの主要モジュールを組み合わせています:

  1. レイアウト認識:DEIMv2 を使用してドキュメントの構造を識別します。
  2. 文字認識:PARSeq を使用して実際の文字を認識します。
  3. 読み順の並べ替え:認識されたテキストを正しい順序に整列します。

モデルは PyTorch で学習され、その後 ONNX 形式に変換されて効率的な実行が可能になります。アプリケーションはデスクトップ GUI(Windows、Mac、Linux をサポート)または Python を使用したコマンドラインインターフェース(CLI)で利用できます。

対象ユーザー

高価なハードウェア(専用GPUなど)を持たない、またはアーカイブ作業にシンプルなデスクトップアプリケーションを好むユーザー向けです。画像から印刷体・手書きの日本語テキストをデジタル化したい方におすすめです。

特徴

  • ハードウェア効率的:GPUを必要とせず、一般的なCPU上で高速に動作します。
  • マルチプラットフォーム:Windows 11、macOS(Apple M4を含む)、Ubuntu 22.04 に対応。
  • 多様な入力形式:JPG、PNG、TIFF、JP2、BMP、WebP などのさまざまな画像形式をサポート。
  • 手書き文字対応:v1.2 以降、手書き文字の認識が強化されています。
  • 柔軟な出力形式:XML または JSON 形式で結果を出力可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト