aws/aws-sdk-pandas

pandas on AWS - Easy integration with Athena, Glue, Redshift, Timestream, Neptune, OpenSearch, QuickSight, Chime, CloudWatchLogs, DynamoDB, EMR, SecretManager, PostgreSQL, MySQL, SQLServer and S3 (Parquet, CSV, JSON and EXCEL).

何を解決するか

AWS SDK for pandas(旧称 awswrangler)は、pandas DataFrames とさまざまな AWS サービス間でのデータの移動および管理を簡素化します。pandas を AWS データレイク、データベース、分析サービスと統合する際の複雑なボイラープレートコードの記述を不要にします。

仕組み

このライブラリは、AWS SDK をラップする高レベルの Python 関数を提供し、データの直接読み取りおよび書き込みを可能にします。S3(Parquet、CSV、JSON、Excel)、Athena、Glue、Redshift、Timestream、OpenSearch、Neptune、DynamoDB などの幅広い AWS サービスをサポートしており、PostgreSQL、MySQL、SQL Server などの従来のデータベースも対応しています。

対象ユーザー

データ操作に pandas を使用し、AWS エコシステム全体で効率的にデータの取り込み、保存、クエリを行う必要があるデータエンジニア、データサイエンティスト、アナリスト。

主な特徴

  • 広範な AWS 統合: S3、Athena、Glue、Redshift など、多数の AWS サービスを直接サポート。
  • スケーラビリティ: Modin や Ray と統合することで、ワーカークラスタ上で処理を分散し、スケール可能なワークフローを実行可能。
  • 柔軟なデータフォーマット: S3 上の Parquet、CSV、JSON、Excel ファイルをシームレスに処理。
  • 包括的な API: Glue Data Quality を通じて、スキーマの進化、パーティション投影、データ品質チェックなどの専用ツールを提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト