kubernetes-sigs/dra-driver-nvidia-gpu

DRA Driver for NVIDIA GPUs

解决的问题

该项目通过使用动态资源分配(DRA)框架,提供了一种在 Kubernetes 集群内灵活分配和配置 NVIDIA GPU 的方法。它解决了对更强大 GPU 管理的需求,例如动态重新配置以及为高性能 AI 工作负载实现安全的多节点 NVLink(MNNVL)连接编排。

工作原理

该驱动由两个主要的 kubelet 插件组成,用于管理不同类型的资源:

  • ComputeDomains:此插件管理抽象,确保使用多节点 NVLink 时,Pod 之间具有安全且隔离的可达性,从而保证工作负载可在节点间高效通信。
  • GPUs:此插件负责 GPU 设备的分配,支持多实例 GPU(MIG)设备的动态分配等功能。

适用人群

专为需要管理专用 NVIDIA 硬件以进行大规模 AI 训练或推理的 Kubernetes 管理员和 AI 基础设施工程师设计,尤其适用于使用 NVIDIA GB200 系统或需要多节点 GPU 通信的用户。

主要亮点

  • 多节点 NVLink 支持:实现跨不同节点的 Pod 之间安全且可靠的连接编排。
  • 动态资源分配:利用 Kubernetes DRA 框架,将资源配置的控制权交由第三方供应商。
  • 灵活的 GPU 共享:支持单个 GPU 在同一 Pod 内的多个容器之间共享。
  • 临时 ComputeDomains:创建仅在消费工作负载生命周期内存在的隔离通信域。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目