aws/aws-sdk-pandas

pandas on AWS - Easy integration with Athena, Glue, Redshift, Timestream, Neptune, OpenSearch, QuickSight, Chime, CloudWatchLogs, DynamoDB, EMR, SecretManager, PostgreSQL, MySQL, SQLServer and S3 (Parquet, CSV, JSON and EXCEL).

解决的问题

AWS SDK for pandas(原名 awswrangler)简化了在 pandas DataFrames 与各种 AWS 服务之间移动和管理数据的过程。它消除了在将 pandas 与 AWS 数据湖、数据库和分析服务集成时编写复杂样板代码的需要。

工作原理

该库提供了一组高级 Python 函数,封装了 AWS SDK,允许直接读取和写入数据。它支持广泛的 AWS 服务,包括 S3(Parquet、CSV、JSON、Excel)、Athena、Glue、Redshift、Timestream、OpenSearch、Neptune 和 DynamoDB,以及 PostgreSQL、MySQL 和 SQL Server 等传统数据库。

适用人群

使用 pandas 进行数据操作,并需要在 AWS 生态系统中高效地摄取、存储和查询数据的数据工程师、数据科学家和分析师。

主要亮点

  • 广泛的 AWS 集成:直接支持 S3、Athena、Glue 和 Redshift 等大量 AWS 服务。
  • 可扩展性:通过与 Modin 和 Ray 集成,可在工作节点集群上分发处理,实现大规模工作流运行。
  • 灵活的数据格式:无缝处理 S3 上的 Parquet、CSV、JSON 和 Excel 文件。
  • 全面的 API:通过 Glue Data Quality 提供专门的工具,支持模式演化、分区投影和数据质量检查。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目