aws-samples/amazon-textract-textractor

Analyze documents with Amazon Textract and generate output in multiple formats.

해결하는 문제

Textractor는 문서 인텔리전스 서비스인 Amazon Textract와 상호작용하는 과정을 간소화합니다. 원시 API 호출과 결과 JSON 응답을 파싱하는 복잡성을 제거하여, 단순한 스크립트부터 복잡한 분산 문서 처리 파이프라인까지 구축하기 쉽게 만듭니다.

작동 방식

Amazon Textract API를 감싸는 Python 래퍼로, 다양한 문서 분석 작업을 수행할 수 있는 고수준 인터페이스를 제공합니다. 이미지, 바이트, 또는 S3 경로를 처리할 수 있으며, 특정 목적에 맞는 전용 메서드를 제공합니다:

  • 텍스트 인식: 문서에서 원시 텍스트를 추출합니다.
  • 테이블 추출: 테이블에서 구조화된 데이터를 식별하고 추출할 수 있으며, Excel과 같은 형식으로 내보낼 수 있습니다.
  • 폼 처리: 키-값 쌍을 추출하고, 유사 매칭(fuzzy matching)을 지원합니다.
  • 신분증 분석: 신분증에서 특정 필드를 추출합니다.
  • 비용 처리: 영수증에서 요약 필드를 추출합니다.

대상 사용자

AWS 서비스를 사용하여 문서에서 구조화된 데이터를 추출해야 하는 개발자 및 데이터 엔지니어. 저수준 API 응답에 신경 쓰지 않아도 됩니다.

주요 특징

  • 포괄적인 도구 세트: API 호출, 응답 파싱, 경계 상자 그리기(오버레이), 출력을 CSV, 텍스트, 또는 마크다운(프리티프린터)으로 변환하는 통합 유틸리티를 포함합니다.
  • 유연한 설치: AWS Lambda용 최소 버전과 pandas, PDF 래스터라이제이션(pdfium 또는 pdf), ML 기반 단어 검색용 torch를 선택적으로 추가할 수 있습니다.
  • CLI 지원: 터미널에서 직접 API 호출 및 결과 오버레이를 실행할 수 있는 명령줄 인터페이스를 제공합니다.
  • 다중 소스 지원: 로컬 이미지, 이미지 목록, 바이트, S3 경로 등 다양한 파일 소스를 처리합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트