tesseract-ocr/tesseract

Tesseract Open Source OCR Engine (main repository)

What it solves

テキスト画像からマシンリーダブルなテキストへの変換、すなわち光学文字認識 (OCR) と呼ばれるプロセスを提供します。これにより、ユーザーはさまざまな画像形式からテキストを抽出し、プレーンテキスト、PDF、HTML などの形式で出力することが可能です。

How it works

Tesseractは、2つの異なるOCRエンジンを使用します。行認識に特化した Long Short-Term Memory (LSTM) ベースの現代的なニューラルネットワークと、個々の文字パターンを認識するレガシーエンジンです。入力画像(PNG, JPEG, TIFF など)を処理し、、訓練済みデータファイルを使用して 100 以上の異なる言語のテキストを認識します。

Who it's for

テキスト抽出のためのコマンドラインツールを必要とするエンドユーザーと、libtesseract C/C++ API を通じて自らのアプリケーションに OCR 機能を集約させる開発者の両方を対象としています。

Highlights

  • 標準で100以上の言語をサポートしています。
  • プレーンテキスト、hOCR、PDF、TSV、ALTO, および PAGE の複数の出力形式を提供します。
  • Unicode (UTF-8) をサポートしています。
  • 新しい言語を認識するためにトレーニング可能です。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト