aws-solutions-library-samples/accelerated-intelligent-document-processing-on-aws

The IDP Accelerator provides a scalable, serverless approach for automated document processing and information extraction using AWS services, such as Amazon Bedrock Data Automation and Amazon Bedrock foundational models. It combines generative AI and optical character recognition (OCR) to process documents at scale.

解決的問題

本專案提供一個可擴展的無伺服器文件處理系統。透過結合光學字元辨識(OCR)與生成式AI,解決大量非結構化文件轉換為結構化資料的挑戰,減少手動資料輸入與提取的需求。

運作方式

基於AWS無伺服器技術(Lambda、Step Functions、SQS、DynamoDB)建構,此系統提供兩種主要處理模式:

  1. 流程模式:依序執行OCR、基於Bedrock的分類(頁面層級或整體)、基於Bedrock的提取、信任度評估、規則驗證與摘要生成。
  2. BDA模式:使用Bedrock Data Automation(BDA)進行端對端處理,隨後進行規則驗證與摘要生成。

使用者可透過Web UI、直接上傳S3檔案,或使用專用命令列介面(CLI)進行批次處理與評估與系統互動。

適用對象

適用於需要大規模處理大量文件的組織、尋求模組化框架以實現智慧文件處理(IDP)的開發者,以及需要人工介入驗證關鍵資料提取結果的企業。

主要亮點

  • 無伺服器架構:完全管理的AWS基礎設施,實現高吞吐量與成本最佳化。
  • 彈性處理:支援模組化流程與端對端BDA模式兩種處理方式。
  • AI驅動的品質控制:包含基於LLM的提取信任度評估,以及基於AI的評估框架,用於衡量與基準的準確性。
  • 人機協同(HITL):內建審查系統,支援人工驗證提取的資料。
  • 可擴展性:支援少樣本範例提示、透過Lambda實作自訂業務邏輯,以及透過Model Context Protocol(MCP)整合外部分析工具。
  • 完整的工具鏈:包含用於監控的Web UI、用於程式化批次執行的CLI,以及用於查詢已處理文件的知識庫。

相關

  • 專案
  • 專案
  • 專案
  • 專案