pdpipe/pdpipe

Easy pipelines for pandas DataFrames.

何を解決するか

pdpipe は pandas DataFrames 用のデータ前処理パイプラインを作成するプロセスを簡素化します。断片的で繰り返しの多いデータクリーニングや変換ステップを、構造的でチェーン可能な操作のシーケンスに置き換えます。

どう動くか

このライブラリは、連結可能な「ステージ」(変換ステップ)のセットを提供します。ユーザーはこれらのステージをリンクしてパイプラインを定義し、それを DataFrame に適用します。列の削除、ワンホットエンコーディング、値のマッピングなどの一般的なタスクをサポートしており、scikit-learn の変換器と統合可能で、DataFrame の列コンテキストを維持します。

対象ユーザー

データ準備に pandas を使用し、特徴量エンジニアリングや前処理をより組織的で再現可能な方法で扱いたいデータサイエンティストやアナリスト。

特徴

  • 即時利用可能なステージ: 列の削除、値のフィルタリング、ワンホットエンコーディング、特徴量生成のための組み込みツールを含む。
  • 可視化診断: パイプラインの Graphviz DOT 図を生成して可視化可能。
  • ドライラン診断: 各ステージごとの構造化診断を行うための .trace() メソッドを備える。
  • 並列実行: 行および列への適用に対して、オプションのスレッドベース並列実行をサポート。
  • scikit-learn 統合: scikit-learn 変換器をラップして、pandas DataFrames とシームレスに連携できるようにする。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト