mljar/mljar-supervised
Python package for AutoML on Tabular Data with Feature Engineering, Hyper-Parameters Tuning, Explanations and Automatic Documentation
What it solves
mljar-supervised 是一個用於表格數據的自動化機器學習 (AutoML) 套件,旨在減少數據科學家在預處理數據、選擇演算法與調優超參數所需的時長與精力。它旨在擺脫「黑盒」AutoML,透過為每個訓練的模型提供詳細的 Markdown 報告,確保過程透明且可解釋。
How it works
該工具抽象化了常見的 ML pipeline—從數據預處理(填補缺失值、類別轉換)與進階特徵工程(Golden Features、文本/時間轉換)到模型選擇與超參數調優。它支持廣泛的演算法,包括 Linear models、Random Forest、LightGBM、Xgboost、CatBoost 與 Neural Networks。
它以四種不同的模式運行:
- Explain: 專注於使用簡單模型與廣泛的 SHAP 與排列重要性圖表來理解數據。
- Perform: 針對生產環境就緒的 pipeline 使用 5-fold cross-validation 來進行優化。
- Compete: 專為 ML 競賽設計,利用 ensembling 與 stacking 進行最大化性能。
- Optuna: 在計算時間不是限制因素時,使用 Optuna 框架進行密集的超參數調優。
Who it’s for
它專為數據科學家與 ML 工程師設計,旨在自動化表格數據監督式學習 pipeline 的重複性工作,同時保持對模型為何做出特定預測的完全可視化。
Highlights
- Transparent Reporting: 自動生成包含指標、圖表與模型特定細節(例如:決策樹視覺化)的詳細 Markdown 報告。
- Explainability: 集成了 SHAP 解釋、排列重要性與線性係數,使模型具有可解釋性。 hought}```json {
相關
- 專案
- 專案
- 專案
- 專案
- 專案