deepdoctection/deepdoctection

A Repo For Document AI

解決する課題

Deepdoctectionは、ドキュメント理解という複雑なタスクを処理するために設計されています。レイアウト解析、OCR、および分類のための様々なAIモデルをオーケストレーションすることで、非構造化のスキャンデータやPDFドキュメントを構造化データに変換する問題を解決します。

仕組み

このライブラリは、ドキュメント抽出のためのパイプラインを構築するオーケストレーション層として機能します。以下の複数の特化したツールやモデルを統合しています:

  • レイアウト解析 & テーブル認識: PyTorch、Detectron2、およびTransformersを使用。
  • OCR: Tesseract、DocTr、およびAWS Textractをサポート。
  • ドキュメント & トークン分類: LayoutLMファミリー、LiLT、およびBertスタイルのモデルを採用。
  • テキストマイニング: ネイティブPDFにはpdfplumberを使用。
  • 前処理: jdeskewまたはTesseractによる画像の傾き補正および回転を含む。
  • 言語検出: 言語識別にはTransformerベースのモデルを使用。

対象ユーザー

自動化されたドキュメント処理ワークフローの構築、PDFやスキャンデータからの構造化情報の抽出、または特定のタスクに向けた学習済みドキュメントAIモデルの微調整が必要な開発者やデータサイエンティスト。

ハイライト

  • モジュール式パイプライン: 複数のOCRおよびレイアウト解析ツールを単一のワークフローにオーケストレーション。
  • 幅広いモデルサポート: LayoutLM、BERT、RoBERTaなどのモデルのためにHugging Face Hubと統合。
  • PyTorch専用: 最近のリファクタリングにより、ディープラーニングモデル間での一貫したサポートを保証。
  • 微調整機能: ユーザーが物体検出および分類モデルを微調整し、結果として得られるパイプラインを評価することを可能にします。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト