pdpipe/pdpipe

Easy pipelines for pandas DataFrames.

解決的問題

pdpipe 簡化了為 pandas DataFrames 建立資料預處理流程的過程。它將零散且重複的資料清洗與轉換步驟,取代為結構化、可串接的操作序列。

如何運作

該套件提供一組即用的「階段」(轉換步驟),可串接在一起。使用者透過連結這些階段來定義流程,然後將整個流程套用至 DataFrame。支援常見任務,如刪除欄位、獨熱編碼與值對應,並可與 scikit-learn 轉換器整合,同時維持 DataFrame 欄位的上下文。

適用對象

使用 pandas 進行資料準備,並希望以更有序、可重現的方式處理特徵工程與預處理的資料科學家與分析師。

主要特色

  • 即用階段:內建用於欄位刪除、值過濾、獨熱編碼與特徵產生的工具。
  • 視覺化診斷:可產生流程的 Graphviz DOT 圖以進行視覺化。
  • 乾運行診斷:提供 .trace() 方法,用於結構化地診斷各階段。
  • 平行執行:支援可選的線程式平行執行,適用於列與行的應用。
  • 與 scikit-learn 整合:封裝 scikit-learn 轉換器,確保與 pandas DataFrames 無縫協作。

相關

  • 專案
  • 專案
  • 專案
  • 專案