mljar/mljar-supervised

Python package for AutoML on Tabular Data with Feature Engineering, Hyper-Parameters Tuning, Explanations and Automatic Documentation

What it solves

mljar-supervised 是一個用於表格數據的自動化機器學習 (AutoML) 套件,旨在減少數據科學家在預處理數據、選擇演算法與調優超參數所需的時長與精力。它旨在擺脫「黑盒」AutoML,透過為每個訓練的模型提供詳細的 Markdown 報告,確保過程透明且可解釋。

How it works

該工具抽象化了常見的 ML pipeline—從數據預處理(填補缺失值、類別轉換)與進階特徵工程(Golden Features、文本/時間轉換)到模型選擇與超參數調優。它支持廣泛的演算法,包括 Linear models、Random Forest、LightGBM、Xgboost、CatBoost 與 Neural Networks。

它以四種不同的模式運行:

  • Explain: 專注於使用簡單模型與廣泛的 SHAP 與排列重要性圖表來理解數據。
  • Perform: 針對生產環境就緒的 pipeline 使用 5-fold cross-validation 來進行優化。
  • Compete: 專為 ML 競賽設計,利用 ensembling 與 stacking 進行最大化性能。
  • Optuna: 在計算時間不是限制因素時,使用 Optuna 框架進行密集的超參數調優。

Who it’s for

它專為數據科學家與 ML 工程師設計,旨在自動化表格數據監督式學習 pipeline 的重複性工作,同時保持對模型為何做出特定預測的完全可視化。

Highlights

  • Transparent Reporting: 自動生成包含指標、圖表與模型特定細節(例如:決策樹視覺化)的詳細 Markdown 報告。
  • Explainability: 集成了 SHAP 解釋、排列重要性與線性係數,使模型具有可解釋性。 hought}```json {

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案