kubernetes-sigs/dra-driver-nvidia-gpu
DRA Driver for NVIDIA GPUs
解决的问题
该项目通过使用动态资源分配(DRA)框架,提供了一种在 Kubernetes 集群内灵活分配和配置 NVIDIA GPU 的方法。它解决了对更强大 GPU 管理的需求,例如动态重新配置以及为高性能 AI 工作负载实现安全的多节点 NVLink(MNNVL)连接编排。
工作原理
该驱动由两个主要的 kubelet 插件组成,用于管理不同类型的资源:
- ComputeDomains:此插件管理抽象,确保使用多节点 NVLink 时,Pod 之间具有安全且隔离的可达性,从而保证工作负载可在节点间高效通信。
- GPUs:此插件负责 GPU 设备的分配,支持多实例 GPU(MIG)设备的动态分配等功能。
适用人群
专为需要管理专用 NVIDIA 硬件以进行大规模 AI 训练或推理的 Kubernetes 管理员和 AI 基础设施工程师设计,尤其适用于使用 NVIDIA GB200 系统或需要多节点 GPU 通信的用户。
主要亮点
- 多节点 NVLink 支持:实现跨不同节点的 Pod 之间安全且可靠的连接编排。
- 动态资源分配:利用 Kubernetes DRA 框架,将资源配置的控制权交由第三方供应商。
- 灵活的 GPU 共享:支持单个 GPU 在同一 Pod 内的多个容器之间共享。
- 临时 ComputeDomains:创建仅在消费工作负载生命周期内存在的隔离通信域。
相关
- 项目
- 项目
- 项目
- 项目
- 项目