kubeflow/mpi-operator

Kubernetes Operator for MPI-based applications (distributed training, HPC, etc.)

解決的問題

它簡化了在 Kubernetes 上執行 allreduce 風格的分散式訓練的流程,這通常在多個節點與 GPU 之間協調相當複雜。

如何運作

本專案提供一個 Kubernetes Operator,引入了一個稱為 MPIJob 的自訂資源。使用者在 YAML 檔案中定義訓練設定——包括工作節點數量與 GPU 要求。Operator 隨後管理該工作流程的生命周期,協調啟動器與工作節點 Pod 以執行分散式訓練任務。

適用對象

需要使用基於 MPI 的分散式訓練框架,在 Kubernetes 集群上擴展 AI 訓練工作負載的機器學習工程師與平台運維人員。

主要特色

  • 支援 GPU 加速的多節點分散式訓練。
  • 與 Intel MPI 和 MPICH 等常見 MPI 實作整合。
  • 透過公開的指標提供內建監控,涵蓋任務建立、成功與失敗比率。
  • 與更廣泛的 Kubeflow 生態系統相容。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案