aws-samples/amazon-textract-textractor

Analyze documents with Amazon Textract and generate output in multiple formats.

何を解決するか

Textractorは、ドキュメントインテリジェンスサービスであるAmazon Textractとのやり取りを簡素化します。直接API呼び出しを行い、結果のJSON応答をパースする複雑さを排除し、単純なスクリプトから複雑な分散ドキュメント処理パイプラインまで、開発を容易にします。

動作方法

Amazon Textract APIのPythonラッパーとして機能し、さまざまなドキュメント分析タスクを実行するための高レベルインターフェースを提供します。画像、バイトデータ、またはS3パスを処理でき、特定のニーズに応じた専用メソッドを提供します:

  • テキスト認識:ドキュメントからテキストを抽出。
  • テーブル抽出:テーブルから構造化データを識別・抽出でき、Excelなどのフォーマットにエクスポート可能。
  • フォーム処理:キーと値のペアを抽出し、曖昧一致(fuzzy matching)をサポート。
  • 身分証明書分析:IDから特定のフィールドを抽出。
  • 経費処理:領収書から要約フィールドを抽出。

対象ユーザー

AWSサービスを使ってドキュメントから構造化データを抽出する必要がある開発者やデータエンジニア。低レベルのAPI応答に煩わされずに済みます。

特徴

  • 包括的なツールキット:API呼び出し、応答のパース、バウンディングボックスの描画(オーバーレイ)、出力をCSV、テキスト、またはMarkdown(prettyprinter)に変換する統合ユーティリティを備えています。
  • 柔軟なインストール:AWS Lambda用の最小バージョンと、pandas、PDFラスタライズ(pdfiumまたはpdf経由)、およびMLベースの単語検索用のtorchをオプションで追加可能。
  • CLIサポート:ターミナルから直接API呼び出しや結果のオーバーレイを実行できるコマンドラインインターフェースを提供。
  • マルチソース対応:ローカル画像、画像のリスト、バイトデータ、S3パスなど、さまざまなファイルソースに対応。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト