pdpipe/pdpipe
Easy pipelines for pandas DataFrames.
解决的问题
pdpipe 简化了为 pandas DataFrames 创建数据预处理管道的过程。它将零散、重复的数据清洗和转换步骤替换为结构化、可链式的操作序列。
如何工作
该库提供了一组现成的「阶段」(转换步骤),可以串联在一起。用户通过链接这些阶段来定义管道,然后将整个管道应用于 DataFrame。它支持常见的任务,如删除列、独热编码和值映射,并且可以与 scikit-learn 变换器集成,同时保持 DataFrame 列的上下文。
适用人群
使用 pandas 进行数据准备,并希望以更有序、可复现的方式处理特征工程和预处理的数据科学家和分析师。
主要亮点
- 现成阶段:包含用于列删除、值过滤、独热编码和特征生成的内置工具。
- 可视化诊断:可生成管道的 Graphviz DOT 图以进行可视化。
- 干运行诊断:提供
.trace()方法,用于结构化地诊断每个阶段。 - 并行执行:支持可选的基于线程的并行执行,用于行和列的应用。
- 与 scikit-learn 集成:封装 scikit-learn 变换器,确保它们与 pandas DataFrames 无缝协作。
相关
- 项目
- 项目
- 项目
- 项目