OCR4all/OCR4all

Provides OCR (Optical Character Recognition) services through web applications

解決する課題

OCR4all は、歴史的な印刷物に対して光学文字認識 (OCR) を実行するための半自動ワークフローを提供します。技術的な背景知識がないユーザーでも、標準的な OCR ツールでは処理が難しい初期の刊本から高品質なテキスト認識結果を得られるように設計されています。

仕組み

このプロジェクトは、文書解析やテキスト認識のためのいくつかの専門的なツールを統合しています。これには OCRopus、Calamari、およびレイアウト解析用の LAREX が含まれます。ワークフローを管理するためのメインインターフェースとサーバーを提供しており、自動化がうまくいかない場合に手動で介入して結果を修正し、精度を高めることが可能です。

対象ユーザー

歴史的な文書や初期の刊本をデジタルテキストに書き起こす必要がある研究者、歴史家、および技術的な背景を持たないユーザー。

ハイライト

  • 手動での修正や介入が可能な半自動ワークフロー。
  • 歴史的な印刷物や初期の刊本に特化して最適化。
  • 複数の OCR エンジンと文書解析プログラムを統合。
  • インストールを容易にするため、設定済みの Docker イメージとして提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト