kubernetes-sigs/dra-driver-nvidia-gpu
DRA Driver for NVIDIA GPUs
解決的問題
本專案透過使用動態資源配置(DRA)框架,提供在 Kubernetes 集群內靈活分配與設定 NVIDIA GPU 的方法。解決對更強大 GPU 管理的需求,例如動態重新配置,以及為高效率 AI 工作負載實作安全的多節點 NVLink(MNNVL)連線編排。
工作原理
此驅動由兩個主要的 kubelet 插件組成,用於管理不同類型的資源:
- ComputeDomains:此插件管理抽象,確保使用多節點 NVLink 時,Pod 之間具有安全且隔離的可達性,進而讓工作負載能在節點間高效通訊。
- GPUs:此插件負責 GPU 裝置的分配,支援多實例 GPU(MIG)裝置的動態分配等功能。
適用對象
專為需要管理專用 NVIDIA 硬體以進行大規模 AI 訓練或推論的 Kubernetes 管理員與 AI 基礎設施工程師設計,特別適用於使用 NVIDIA GB200 系統或需要多節點 GPU 通訊的使用者。
主要亮點
- 多節點 NVLink 支援:實現跨不同節點的 Pod 之間安全且穩健的連線編排。
- 動態資源配置:利用 Kubernetes DRA 框架,將資源設定的控制權交由第三方供應商。
- 靈活的 GPU 共用:支援單一 GPU 在同一 Pod 內的多個容器之間共用。
- 暫時性 ComputeDomains:建立僅在消費工作負載生命週期內存在的隔離通訊領域。
相關
- 專案
- 專案
- 專案
- 專案
- 專案