pdpipe/pdpipe
Easy pipelines for pandas DataFrames.
解決的問題
pdpipe 簡化了為 pandas DataFrames 建立資料預處理流程的過程。它將零散且重複的資料清洗與轉換步驟,取代為結構化、可串接的操作序列。
如何運作
該套件提供一組即用的「階段」(轉換步驟),可串接在一起。使用者透過連結這些階段來定義流程,然後將整個流程套用至 DataFrame。支援常見任務,如刪除欄位、獨熱編碼與值對應,並可與 scikit-learn 轉換器整合,同時維持 DataFrame 欄位的上下文。
適用對象
使用 pandas 進行資料準備,並希望以更有序、可重現的方式處理特徵工程與預處理的資料科學家與分析師。
主要特色
- 即用階段:內建用於欄位刪除、值過濾、獨熱編碼與特徵產生的工具。
- 視覺化診斷:可產生流程的 Graphviz DOT 圖以進行視覺化。
- 乾運行診斷:提供
.trace()方法,用於結構化地診斷各階段。 - 平行執行:支援可選的線程式平行執行,適用於列與行的應用。
- 與 scikit-learn 整合:封裝 scikit-learn 轉換器,確保與 pandas DataFrames 無縫協作。
相關
- 專案
- 專案
- 專案
- 專案