mindee/doctr

docTR (Document Text Recognition) - a seamless, high-performing & accessible library for OCR-related tasks powered by Deep Learning. Ongoing development and maintenance by t2k.

何を解決するか

docTR は、ドキュメント上で光学文字認識(OCR)を実行するためのシームレスでアクセスしやすい方法を提供します。PDF、画像、またはウェブページから単語の位置を特定し、文字を識別することで、テキスト情報を解析し、視覚的なドキュメントデータを機械可読テキストに変換できます。

動作方法

このライブラリは、エンドツーエンドOCRのための2段階アプローチを使用しています:

  1. テキスト検出:DBNet、LinkNet、FASTなどのアーキテクチャを使用して、ページ上の単語の位置を特定します。
  2. テキスト認識:CRNN、SAR、MASTER、ViTSTR、PARSeq、VIPTRなどのアーキテクチャを使用して、特定された単語内の文字を識別します。

さらに、KIE(キー情報抽出)予測モデル(例:日付や住所などの特定クラスの情報の検出)と、タイトル、表、フッターなどの領域を識別するレイアウト検出モデルも提供しています。

対象ユーザー

シンプルなスクリプトベースの分析から、FastAPIを使用した完全なAPIデプロイまで、高品質なOCRおよびドキュメント分析をアプリケーションに統合したい開発者や組織向けに設計されています。

特徴

  • 柔軟なアーキテクチャ:検出および認識の両方で複数の事前学習済みモデルをサポート。
  • 多様な入力:PDF、画像、URLを処理可能。
  • ドキュメント構造:Page、Block、Line、Wordというネストされたオブジェクト構造を返し、JSONにエクスポート可能。
  • レイアウト&表分析:ドキュメントのレイアウト領域や表構造の検出機能を備えています。
  • デプロイ準備完了:DockerイメージとFastAPIテンプレートを提供し、迅速なAPI統合が可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト