NVIDIA/gpu-operator
NVIDIA GPU Operator creates, configures, and manages GPUs in Kubernetes
解决的问题
消除了在 Kubernetes 节点上手动配置和管理 NVIDIA GPU 软件的繁琐且易出错的过程。无需为每个 GPU 节点准备专用的 OS 镜像,管理员可以使用标准 OS 镜像,并自动部署所需的驱动程序和运行时。
工作原理
利用 Kubernetes operator 框架,该项目自动管理所有必需的 NVIDIA 软件组件的生命周期。它将这些组件以容器形式部署,包括 NVIDIA 驱动程序(用于 CUDA)、GPU 的 Kubernetes 设备插件、NVIDIA 容器运行时以及基于 DCGM 的监控,同时处理自动节点标签化。
适用人群
需要在云环境或本地环境中快速部署和扩展 GPU 节点,而无需手动管理底层软件栈的 Kubernetes 集群管理员。
主要亮点
- 自动安装 NVIDIA 驱动程序、容器运行时和设备插件。
- 支持 CPU 和 GPU 节点均使用标准 OS 镜像。
- 通过以容器形式运行软件,简化组件更新和替换。
- 提供基于 DCGM 的集成监控。
相关
- 项目
- 项目
- 项目
- 项目
- 项目