ROCm/k8s-device-plugin

Kubernetes (k8s) device plugin to enable registration of AMD GPU to a container cluster

何を解決するか

このプロジェクトは、KubernetesクラスタがAMD GPUを認識して使用できるようにします。デバイスプラグインがなければ、KubernetesはAMD GPUからの特定のハードウェアアクセラレーションを必要とするコンピューティングワークロードをネイティブにスケジュールできません。

動作方法

Kubernetesデバイスプラグインインターフェースを実装しており、AMD GPUをコンテナクラスタ内のスケジュール可能なリソースとして登録できます。通常、AMD GPUを搭載したすべてのノードにDaemonSetとしてデプロイされ、ハードウェアがクラスタのスケジューラに公開されます。また、AMD GPU Operatorと統合することも可能です。

対象ユーザー

機械学習やハイパフォーマンスコンピューティングなど、計算集約的なタスクにAMDハードウェアを使用するKubernetesクラスタを管理するシステム管理者およびDevOpsエンジニア。

特徴

  • Kubernetes統合: AMD GPUを標準のスケジュール可能なリソースとして扱えるようにします。
  • ヘルスモニタリング: gRPCソケットサービスを介してGPUごとの細粒度のヘルス検出を実験的にサポートします。
  • 柔軟なデプロイ: 標準のYAMLマニフェストまたはHelmチャートでデプロイ可能です。
  • ノードラベリング: クラスタノードに追加のGPUプロパティを追加するためのノードラベラーを含んでいます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト