ocrmypdf/OCRmyPDF

OCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched

何を解決するか

OCRmyPDF は、テキストの画像にすぎないスキャンされた PDF ファイルを、検索可能でコピー&ペースト可能なドキュメントに変換します。隠し OCR テキストレイヤーを追加することで、他の OCR ツールに見られるテキストのずれ、多言語対応の不足、画像解像度の低下、巨大または無効な PDF ファイルの生成といった問題を解決します。

動作方法

Python で書かれたスクリプタブルなコマンドラインツールで、Tesseract OCR エンジンを統合して 100 言語以上を認識します。このツールは PDF を処理し、オプションで画像をクリーンアップ(ページの傾き補正や回転)し、認識されたテキストを元の画像の下に正確に挿入します。PDF/A ファイル(長期保存に特化)を生成でき、複数の CPU コアを使って作業を分散することで効率を高めます。

対象ユーザー

大量のスキャンされたドキュメントをデジタル化したいユーザー、コマンドラインから PDF 処理を自動化したい開発者、長期保存用に有効な PDF/A ファイルが必要な組織に最適です。

特徴

  • 高忠実度: 元の画像解像度を維持し、可能な限り損失のない操作を実行します。
  • 最適化: 入力ファイルよりも最終的なファイルサイズを小さくすることが多いです。
  • 画像補正: 書き込みがずれたページや誤って回転したページを補正する内蔵機能を備えています。
  • 拡張性: Tesseract を EasyOCR や PaddleOCR などの他のエンジンに置き換えるためのプラグインインターフェースを提供しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト