scribeocr/scribeocr

Web interface for recognizing text, proofreading OCR, and creating fully-digitized documents.

何を解決するか

Scribe OCRは、不正確または不適切に配置されたOCR(光学文字認識)データの問題を解決するように設計されています。従来のOCRツールはしばしば画像の上に「見えないテキスト」レイヤーを粗く配置するのに対し、Scribe OCRは高精度な配置と効率的な校正に注力し、OCRの正確性を98%から100%に引き上げます。

動作方法

アプリケーションは完全にブラウザ内で実行され、データがリモートサーバーに送信されることはありません。テキスト認識にはScribe.jsライブラリを使用します。誤りをより簡単に発見できるように、各ドキュメントごとにカスタムフォントを生成し、元のスキャンとオーバーレイテキストの配置を最適化します。編集可能なテキストがソース画像の上に正確に重ねられる専用の校正モードを提供し、信頼度が低い文字を赤で強調表示してユーザーをガイドします。

対象ユーザー

元のドキュメントのレイアウトを画像背景なしで正確に再現する完全デジタル化されたebookスタイルのPDFを作成したいユーザー、正確な検索可能なPDFを作成したいユーザー、または既存のOCRデータ(Tesseract HOCRファイルを含む)を校正したいユーザーに適しています。

特徴

  • ブラウザベースの処理:すべての認識および処理がブラウザ内でローカルで行われます。
  • フォント最適化:ドキュメントごとにカスタムフォントを生成し、テキストの配置精度と誤り検出を向上させます。
  • ebookモード:小ファイルサイズのテキストネイティブPDFを生成し、元のレイアウトを忠実に再現します。
  • 柔軟なエクスポート:ebookスタイルのPDFと従来の画像上に見えないテキストのPDFの両方をサポートします。
  • HOCR対応:他のアプリケーションからのOCRデータを編集・修正できる機能があります。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト