aws/aws-sdk-pandas
pandas on AWS - Easy integration with Athena, Glue, Redshift, Timestream, Neptune, OpenSearch, QuickSight, Chime, CloudWatchLogs, DynamoDB, EMR, SecretManager, PostgreSQL, MySQL, SQLServer and S3 (Parquet, CSV, JSON and EXCEL).
해결하는 문제
AWS SDK for pandas(이전 이름: awswrangler)는 pandas DataFrames와 다양한 AWS 서비스 간의 데이터 이동 및 관리를 간소화합니다. pandas를 AWS 데이터 레이크, 데이터베이스, 분석 서비스와 통합할 때 복잡한 반복 코드를 작성할 필요가 없습니다.
작동 방식
이 라이브러리는 AWS SDK를 래핑하는 고수준 Python 함수 세트를 제공하여 데이터를 직접 읽고 쓸 수 있도록 합니다. S3(Parquet, CSV, JSON, Excel), Athena, Glue, Redshift, Timestream, OpenSearch, Neptune, DynamoDB를 포함한 다양한 AWS 서비스를 지원하며, PostgreSQL, MySQL, SQL Server와 같은 전통적인 데이터베이스도 지원합니다.
대상 사용자
데이터 조작에 pandas를 사용하고 AWS 생태계 전반에서 데이터를 효율적으로 가져오고 저장하며 쿼리해야 하는 데이터 엔지니어, 데이터 과학자, 분석가.
주요 특징
- 광범위한 AWS 통합: S3, Athena, Glue, Redshift 등 다양한 AWS 서비스를 직접 지원.
- 확장성: Modin과 Ray와 통합하여 워커 클러스터에서 처리를 분산하여 대규모 워크플로우를 실행할 수 있습니다.
- 유연한 데이터 형식: S3 상의 Parquet, CSV, JSON, Excel 파일을 원활하게 처리.
- 포괄적인 API: Glue Data Quality를 통해 스키마 진화, 파티션 프로젝션, 데이터 품질 검사와 같은 전용 도구를 제공.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트