NVIDIA/gpu-operator
NVIDIA GPU Operator creates, configures, and manages GPUs in Kubernetes
何を解決するか
Kubernetes ノード上で NVIDIA GPU ソフトウェアを設定・管理する手作業でエラーが発生しやすいプロセスを排除します。各 GPU ノードに専用の OS イメージを用意する必要はなく、標準の OS イメージを使用して必要なドライバーやランタイムのデプロイを自動化できます。
動作方法
Kubernetes operator フレームワークを使用して、必要なすべての NVIDIA ソフトウェアコンポーネントのライフサイクルを自動化します。NVIDIA ドライバー(CUDA 用)、GPU の Kubernetes デバイスプラグイン、NVIDIA コンテナランタイム、DCGM を用いたモニタリングをコンテナとしてデプロイし、自動的なノードラベリングも処理します。
対象ユーザー
クラウドまたはオンプレミス環境にわたり、手動で下位ソフトウェアスタックを管理せずに、GPU ノードを迅速にプロビジョニングおよびスケーリングする必要がある Kubernetes クラスタ管理者。
特徴
- NVIDIA ドライバー、コンテナランタイム、デバイスプラグインのインストールを自動化。
- CPU ノードおよび GPU ノードの両方で標準の OS イメージを使用可能。
- ソフトウェアをコンテナとして実行することで、コンポーネントの更新や切り替えを簡素化。
- DCGM を用いた統合モニタリングを提供。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト