mljar/mljar-supervised
Python package for AutoML on Tabular Data with Feature Engineering, Hyper-Parameters Tuning, Explanations and Automatic Documentation
What it solves
mljar-supervised は、表形式データ向けの自動化機械学習 (AutoML) パッケージであり、データサイエンティストがデータの前処理、アルゴリズムの選択、ハイパーパラメータのチューニングに要する時間と労力を削減します。すべての訓練済みモデルに対して詳細な Markdown レポートを提供することで、「ブラックボックス」な AutoML から脱却し、プロセスを透明かつ説明可能にすることを目指しています。
How it works
このツールは、データ前処理(補完、カテゴリ変換)や高度な特徴量エンジニアリング(Golden Features、テキスト/時間変換)から、モデル選択やハイパーパラメータチューニングに至るまで、一般的な ML pipeline を抽象化します。Linear models、Random Forest、LightGBM、Xgboost、CatBoost、Neural Networks を含む幅広いアルゴリズムをサポートしています。
以下の 4 つの異なるモードで動作します:
- Explain: シンプルなモデルと広範な SHAP および置換重要度プロットを使用して、データの理解に焦点を当てます。
- Perform: 5-fold cross-validation を使用して、プロダクション環境向けのパイプラインに最適化します。
- Compete: ML コンペティション向けに設計されており、ensembling と stacking を利用して最大限のパフォーマンスを発揮します。
- Optuna: 計算時間が制限されない場合、Optuna フレームワークを使用して集中的なハイパーパラメータチューニングを行います。
Who it’s for
表形式データの教師あり学習パイプラインの反復的な部分を自動化しつつ、モデルがなぜ特定の予測を行うのかを完全に可視化したいデータサイエンティストや ML エンジニア向けに設計されています。
Highlights
- Transparent Reporting: 指標、チャート、モデル固有の詳細(例:決定木的可視化)を含む詳細な Markdown レポートを自動生成します。
- Explainability: SHAP による説明、置換重要性、および線形係数を統合し、モデルを解釈可能にします。
- Web App Generation: Mercury を介して、非技術的なドメインエキスパート向けにインタラクティブな予測 Web アプリを自動的に作成できます。
- Fairness Aware Training: サンプルの重み付けやスマートグリッドサーチなどのバイアス緩和技術を含み、公平性指標を最適化します。
- Automatic Persistence: モデルを自動的に保存およびロードすることで、中断後にトレーニングを再開できるようにします。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト