NVIDIA/gpu-operator

NVIDIA GPU Operator creates, configures, and manages GPUs in Kubernetes

解決的問題

消除在 Kubernetes 節點上手動設定與管理 NVIDIA GPU 軟體的繁瑣且容易出錯的流程。無需為每個 GPU 節點準備專用的 OS 映像,管理者可使用標準 OS 映像,並自動部署所需的驅動程式與執行環境。

作法

利用 Kubernetes operator 架構,本專案自動管理所有必要 NVIDIA 軟體元件的生命周期。以容器形式部署這些元件,包括 NVIDIA 驅動程式(用於 CUDA)、GPU 的 Kubernetes 裝置外掛程式、NVIDIA 容器執行環境,以及基於 DCGM 的監控,同時處理自動節點標籤化。

適用對象

需要在雲端或內部部署環境中快速部署與擴展 GPU 節點,而無需手動管理底層軟體堆疊的 Kubernetes 集群管理者。

主要特色

  • 自動安裝 NVIDIA 驅動程式、容器執行環境與裝置外掛程式。
  • 支援 CPU 與 GPU 節點皆使用標準 OS 映像。
  • 透過以容器形式執行軟體,簡化元件更新與替換。
  • 提供基於 DCGM 的整合監控。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案