aws/aws-sdk-pandas

pandas on AWS - Easy integration with Athena, Glue, Redshift, Timestream, Neptune, OpenSearch, QuickSight, Chime, CloudWatchLogs, DynamoDB, EMR, SecretManager, PostgreSQL, MySQL, SQLServer and S3 (Parquet, CSV, JSON and EXCEL).

解決的問題

AWS SDK for pandas(原名 awswrangler)簡化了在 pandas DataFrames 與各種 AWS 服務之間移動和管理資料的過程。它消除了在將 pandas 與 AWS 數據湖、資料庫和分析服務整合時撰寫複雜樣板程式碼的需要。

工作原理

該套件提供一組高階 Python 函數,封裝 AWS SDK,以允許直接讀取和寫入資料。它支援廣泛的 AWS 服務,包括 S3(Parquet、CSV、JSON、Excel)、Athena、Glue、Redshift、Timestream、OpenSearch、Neptune 和 DynamoDB,以及 PostgreSQL、MySQL 和 SQL Server 等傳統資料庫。

適用對象

使用 pandas 進行資料操作,並需要在 AWS 生態系統中高效地擷取、儲存和查詢資料的資料工程師、資料科學家和分析師。

主要亮點

  • 廣泛的 AWS 集成:直接支援 S3、Athena、Glue 和 Redshift 等大量 AWS 服務。
  • 可擴展性:透過與 Modin 和 Ray 集成,可在工作節點叢集上分散處理,實現大規模工作流程執行。
  • 靈活的資料格式:無縫處理 S3 上的 Parquet、CSV、JSON 和 Excel 檔案。
  • 全面的 API:透過 Glue Data Quality 提供專用工具,支援模式演化、分區投影和資料品質檢查。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案