kubeflow/mpi-operator

Kubernetes Operator for MPI-based applications (distributed training, HPC, etc.)

何を解決するか

Kubernetes上でallreduceスタイルの分散学習を実行するプロセスを単純化します。これは通常、複数のノードとGPUにまたがって調整するのが複雑です。

動作方法

このプロジェクトは、カスタムリソースMPIJobを導入するKubernetes Operatorを提供します。ユーザーはYAMLファイルでトレーニングの設定(ワーカー数やGPU要件など)を定義します。Operatorはジョブのライフサイクルを管理し、ランチャーポッドとワーカーポッドを調整して分散学習タスクを実行します。

対象ユーザー

MPIベースの分散学習フレームワークを使用してKubernetesクラスタ上でAIトレーニングワークロードをスケーリングする必要があるMLエンジニアおよびプラットフォームオペレーター。

特徴

  • GPU加速を備えたマルチノード分散学習をサポート。
  • Intel MPIやMPICHなどの一般的なMPI実装と統合。
  • ジョブ作成、成功、失敗率のメトリクスを公開することで、組み込みのモニタリングを提供。
  • より広範なKubeflowエコシステムと互換性あり。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト