pdpipe/pdpipe

Easy pipelines for pandas DataFrames.

解决的问题

pdpipe 简化了为 pandas DataFrames 创建数据预处理管道的过程。它将零散、重复的数据清洗和转换步骤替换为结构化、可链式的操作序列。

如何工作

该库提供了一组现成的「阶段」(转换步骤),可以串联在一起。用户通过链接这些阶段来定义管道,然后将整个管道应用于 DataFrame。它支持常见的任务,如删除列、独热编码和值映射,并且可以与 scikit-learn 变换器集成,同时保持 DataFrame 列的上下文。

适用人群

使用 pandas 进行数据准备,并希望以更有序、可复现的方式处理特征工程和预处理的数据科学家和分析师。

主要亮点

  • 现成阶段:包含用于列删除、值过滤、独热编码和特征生成的内置工具。
  • 可视化诊断:可生成管道的 Graphviz DOT 图以进行可视化。
  • 干运行诊断:提供 .trace() 方法,用于结构化地诊断每个阶段。
  • 并行执行:支持可选的基于线程的并行执行,用于行和列的应用。
  • 与 scikit-learn 集成:封装 scikit-learn 变换器,确保它们与 pandas DataFrames 无缝协作。

相关

  • 项目
  • 项目
  • 项目
  • 项目