UB-Mannheim/zotero-ocr
Zotero Plugin for OCR
何を解決するか
Zotero内でのPDFファイルに対する光学式文字認識(OCR)を可能にし、検索不能なPDFを検索可能にし、文書の画像からテキストを抽出します。
動作方法
このプラグインは、Tesseract OCRとpdftoppm(Popplerツールから)をZoteroに統合しています。ユーザーがPDFを選択し、コンテキストメニューからOCRプロセスを開始すると、ツールはドキュメントを処理し、認識されたテキストを含む新しいPDF、認識テキストを含むノート、またはHTML(hOCR)ファイルを生成できます。
対象ユーザー
スキャンされたまたは画像ベースのPDFを検索可能かつアクセス可能にする必要がある、研究者、学生、および学術関係者。
特徴
- Tesseract統合: テキスト認識に業界標準のTesseract OCRエンジンを使用。
- 出力の柔軟性: 認識されたテキストを含む新しいPDF、テキストのみのノート、またはhOCRファイルを生成可能。
- 設定のカスタマイズ: 出力のDPI、Tesseractのページセグメンテーションモード(PSM)、言語/文字セットモデルをカスタマイズ可能。
- 添付ファイル管理: 処理済みPDFを通常の添付ファイルまたはリンクファイルとして追加できます。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト