tesseract-ocr/tesseract
Tesseract Open Source OCR Engine (main repository)
What it solves
テキスト画像からマシンリーダブルなテキストへの変換、すなわち光学文字認識 (OCR) と呼ばれるプロセスを提供します。これにより、ユーザーはさまざまな画像形式からテキストを抽出し、プレーンテキスト、PDF、HTML などの形式で出力することが可能です。
How it works
Tesseractは、2つの異なるOCRエンジンを使用します。行認識に特化した Long Short-Term Memory (LSTM) ベースの現代的なニューラルネットワークと、個々の文字パターンを認識するレガシーエンジンです。入力画像(PNG, JPEG, TIFF など)を処理し、、訓練済みデータファイルを使用して 100 以上の異なる言語のテキストを認識します。
Who it's for
テキスト抽出のためのコマンドラインツールを必要とするエンドユーザーと、libtesseract C/C++ API を通じて自らのアプリケーションに OCR 機能を集約させる開発者の両方を対象としています。
Highlights
- 標準で100以上の言語をサポートしています。
- プレーンテキスト、hOCR、PDF、TSV、ALTO, および PAGE の複数の出力形式を提供します。
- Unicode (UTF-8) をサポートしています。
- 新しい言語を認識するためにトレーニング可能です。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト