mljar/mljar-supervised

Python package for AutoML on Tabular Data with Feature Engineering, Hyper-Parameters Tuning, Explanations and Automatic Documentation

What it solves

mljar-supervised는 표 형식 데이터를 위한 자동화된 머신러닝 (AutoML) 패키지로, 데이터 과학자가 데이터를 전처리하고 알고리즘을 선택하며 하이퍼파라미터를 튜닝하는 데 필요한 시간과 노력을 줄여줍니다. 모든 훈련된 모델에 대해 상세한 Markdown 보고서를 제공하여 프로세스를 투명하고 설명 가능하게 만듦으로써 "블랙박스" AutoML에서 벗어나는 것을 목표로 합니다.

How it works

이 도구는 데이터 전처리(결측치 보충, 범주형 변환) 및 고급 피처 엔지니어링(Golden Features, 텍스트/시간 변환)부터 모델 선택 및 하이퍼파라미터 튜닝에 이르기까지 일반적인 ML pipeline을 추상화합니다. Linear models, Random Forest, LightGBM, Xgboost, CatBoost, Neural Networks를 포함한 광범위한 알고리즘을을 지원합니다.

다음 네 가지 모드로 작동합니다:

  • Explain: 단순한 모델과 광범위한 SHAP 및 순열 중요도(permutation importance) 플롯을 사용하여 데이터 이해에 집중합니다.
  • Perform: 5-fold cross-validation을 사용하여 프로덕션용 파이프라인에 최적화됩니다.
  • Compete: ML 경진대회를 위해 설계되었으며, ensembling과 stacking을 활용하여 최대 성능을 구현합니다.
  • Optuna: 계산 시간이 제한 요소가 아닌 경우 Optuna 프레임워크를 사용하여 집중적인 하이퍼파라미터 튜닝을 수행합니다.

Who it’s for

표 형식 데이터의 지도 학습 파이프라인에서 반복적인 부분을 자동화하면서도 모델이 왜 특정 예측을을 하는지에 대한 완전한 가시성을 유지하고자 하는 데이터 과학자와 ML 엔지니어를 위해 설계되었습니다.

Highlights

  • Transparent Reporting: 지표, 차트 및 모델별 세부 정보(예: 결정 트리 시각화)가 포함된 상세한 Markdown 보고서를 자동으로 생성합니다.
  • Explainability: SHAP 설명, 순열 중요도 및 선형 계수를 통합하여 모델을 해석 가능하게 만듭니다.
  • Web App Generation: 기술적 지식이 없는 도메인 전문가를 위해 Mercury를 통해 대화형 예측 웹 앱을 자동으로 생성할 수 있습니다.
  • Fairness Aware Training: 샘플 가중치 부여 및 스마트 그리드 서치와 같은 편향 완화 기술을 포함하여 공정성 지표를 최적화합니다.
  • Automatic Persistence: 모델을 자동으로 저장하고 로드하여 중단 후에도 학습을 재개할 수 있도록 합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트