kubeflow/katib

Automated Machine Learning on Kubernetes

解決的問題

Kubeflow Katib 是一個 Kubernetes 原生的自動機器學習(AutoML)專案,旨在自動化尋找機器學習模型的最佳超參數、神經網路架構與早期停止規則的過程。它消除了手動調整模型以達成最佳效能的繁瑣工作。

運作方式

Katib 作為 Kubernetes 上的控制平面運作,扮演一個與框架無關的層,可為任何語言撰寫的應用程式提供超參數調校。它可與 TensorFlow、PyTorch、XGBoost 等多種 ML 框架整合,並可透過 Kubernetes 自訂資源(包括 Kubeflow Training Operator、Argo Workflows 與 Tekton Pipelines)執行訓練作業。

適用對象

主要針對需要在 Kubernetes 上進行可擴展、雲原生超參數調校與架構搜尋的資料科學家與 ML 工程師。

主要特色

  • 廣泛的演算法支援:支援多種搜尋演算法,包括隨機搜尋、網格搜尋、貝氏最佳化、TPE、CMA-ES 與 HyperBand。
  • HPO 與 NAS:提供超參數調校(HPO)、神經網路架構搜尋(ENAS、DARTS)與早期停止(Median Stop)功能。
  • 框架無關性:相容任何 ML 框架與任何程式語言,並可利用現有的工具如 Optuna、Hyperopt 與 Scikit Optimize。
  • Python SDK:提供 Python SDK,簡化調校作業的建立與管理。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案