feature-engine/feature_engine

Feature engineering and selection open-source Python library compatible with sklearn.

何を解決するか

Feature-engine は、機械学習モデルのための特徴量エンジニアリングと選択のための包括的なツールセットを提供し、モデル学習に向けた生データの準備プロセスを簡素化します。このライブラリは、モデルのパフォーマンスを向上させるために生データを変換する課題と、欠損値、外れ値、カテゴリカルデータといった一般的なデータ問題に対処します。

動作方法

このライブラリは、Scikit-learn API に従う複数のトランスフォーマーで構成されており、fit()transform() メソッドを使用します。これにより、トレーニングデータから変換パラメータを学習し、トレーニングセットとテストセットの両方で一貫した変換を適用できます。

対象ユーザー

Python と Scikit-learn を使用して予測モデルを構築し、特徴量エンジニアリングと選択を効果的に扱いたいデータサイエンティストや機械学習エンジニア向けに設計されています。

主な特徴

  • 広範な欠損値補完: 平均値、中央値、ランダムサンプル補完など、さまざまな欠損データ処理方法を提供。
  • カテゴリカルエンコーディング: One-Hot、順序、Weight of Evidence (WoE) など、幅広いエンコーディング手法をサポート。
  • 特徴量選択: 相関が高い特徴量の削除、定数特徴量の除去、再帰的特徴量削除(RFE)などのツールを提供。
  • 多様な変換: 変数のスケーリング、離散化、日時、テキスト、時系列データ専用の変換をサポート。
  • Scikit-learn との統合: Scikit-learn パイプラインと完全に互換性があり、既存の ML ワークフローへの統合が容易です。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト