aws-solutions-library-samples/accelerated-intelligent-document-processing-on-aws
The IDP Accelerator provides a scalable, serverless approach for automated document processing and information extraction using AWS services, such as Amazon Bedrock Data Automation and Amazon Bedrock foundational models. It combines generative AI and optical character recognition (OCR) to process documents at scale.
何を解決するか
このプロジェクトは、スケーラブルでサーバーレスな自動ドキュメント処理システムを提供します。大規模な非構造化ドキュメントを構造化データに変換する課題を、光学文字認識(OCR)と生成AIを組み合わせることで解決し、手動でのデータ入力や抽出の必要性を削減します。
動作方法
AWSサーバーレス技術(Lambda、Step Functions、SQS、DynamoDB)に基づいて構築されたこのシステムは、2つの主要な処理モードを提供します。
- パイプラインモード:OCR、Bedrockベースの分類(ページ単位または全体的)、Bedrockベースの抽出、信頼度評価、ルール検証、要約の順序で処理を行います。
- BDAモード:Bedrock Data Automation(BDA)を用いてエンドツーエンド処理を行い、その後ルール検証と要約を行います。
ユーザーはWeb UI、直接S3へのアップロード、またはバッチ処理と評価用の専用コマンドラインインターフェース(CLI)を通じてシステムと対話できます。
対象ユーザー
大規模なドキュメント処理を必要とする組織、インテリジェントドキュメント処理(IDP)を実装するためのモジュール式フレームワークを探している開発者、および重要なデータ抽出に対して人間による検証を必要とするビジネスに最適です。
主な特徴
- サーバーレスアーキテクチャ:高スループットとコスト最適化を実現する完全管理型AWSインフラストラクチャ。
- 柔軟な処理:モジュール式パイプラインとエンドツーエンドBDAモードの両方をサポート。
- AI駆動の品質管理:LLM駆動の抽出信頼度評価と、基準との比較による精度測定を可能にするAI駆動の評価フレームワークを備えています。
- 人間が関与する(HITL):抽出されたデータの検証を人間が行うための組み込みレビュー機能。
- 拡張性:Few-shot例提示、Lambdaを介したカスタムビジネスロジック、外部分析ツールとの統合に向けたModel Context Protocol(MCP)をサポート。
- 包括的なツールキット:処理済みドキュメントの照会用の知識ベース、モニタリング用Web UI、プログラムによるバッチ実行用CLIを含みます。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト