aws-solutions-library-samples/accelerated-intelligent-document-processing-on-aws

The IDP Accelerator provides a scalable, serverless approach for automated document processing and information extraction using AWS services, such as Amazon Bedrock Data Automation and Amazon Bedrock foundational models. It combines generative AI and optical character recognition (OCR) to process documents at scale.

해결하는 문제

이 프로젝트는 확장 가능하고 서버리스인 자동 문서 처리 시스템을 제공합니다. 대량의 비구조화 문서를 구조화된 데이터로 변환하는 문제를 광학 문자 인식(OCR)과 생성형 AI를 결합함으로써 해결하며, 수동 데이터 입력 및 추출의 필요성을 줄입니다.

작동 방식

AWS 서버리스 기술(Lambda, Step Functions, SQS, DynamoDB) 기반으로 구축된 이 시스템은 두 가지 주요 처리 모드를 제공합니다.

  1. 파이프라인 모드: OCR → Bedrock 기반 분류(페이지 단위 또는 전반적) → Bedrock 기반 추출 → 신뢰도 평가 → 규칙 검증 → 요약의 순서로 처리됩니다.
  2. BDA 모드: Bedrock Data Automation(BDA)를 사용해 엔드투엔드 처리를 수행한 후, 규칙 검증 및 요약을 수행합니다.

사용자는 웹 UI, 직접 S3 업로드, 또는 배치 처리 및 평가를 위한 전용 명령줄 인터페이스(CLI)를 통해 시스템과 상호작용할 수 있습니다.

대상 사용자

대량의 문서를 대규모로 처리해야 하는 조직, 지능형 문서 처리(IDP)를 구현하기 위한 모듈식 프레임워크를 찾는 개발자, 그리고 중요한 데이터 추출에 인간 검증이 필요한 비즈니스에 적합합니다.

주요 특징

  • 서버리스 아키텍처: 고처리량과 비용 최적화를 위한 완전 관리형 AWS 인프라스트럭처.
  • 유연한 처리: 모듈식 파이프라인과 엔드투엔드 BDA 모드를 모두 지원합니다.
  • AI 기반 품질 관리: LLM 기반 추출 신뢰도 평가 및 기준 대비 정확도를 측정할 수 있는 AI 기반 평가 프레임워크를 포함합니다.
  • 인간이 개입하는(HITL): 추출된 데이터의 인간 검증을 위한 내장 리뷰 시스템.
  • 확장성: Few-shot 예시 프롬프팅, Lambda를 통한 사용자 정의 비즈니스 로직, 외부 분석 도구와의 통합을 위한 Model Context Protocol(MCP) 지원.
  • 포괄적인 도구 세트: 모니터링용 웹 UI, 프로그래밍 기반 배치 실행용 CLI, 처리된 문서를 질의할 수 있는 지식 기반을 포함합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트