NVIDIA/deepops

Tools for building GPU clusters

解决的问题

DeepOps 简化了部署和管理 GPU 加速服务器集群的复杂过程。它自动化了必要的软件栈(包括驱动程序、容器运行时和集群管理器)的安装,使研究人员和工程师能够专注于运行 AI 工作负载,而不是手动配置基础设施。

工作原理

DeepOps 使用 Ansible playbook 来编排 GPU 环境的安装和配置。根据用户需求,它可以:

  • 使用 Kubespray 部署完整的 Kubernetes 集群,用于容器化应用管理。
  • 设置 Slurm 集群,用于传统的批处理作业调度和资源管理。
  • 在单台机器上安装必要的 NVIDIA 组件(驱动程序、Docker 和 NVIDIA 容器运行时)。
  • 在支持的系统上部署 NVIDIA DGX 软件栈。

适用人群

专为管理本地数据中心、NVIDIA DGX 系统或任何需要高性能 GPU 集群进行 AI 训练和推理的裸金属环境的系统管理员和 ML 工程师设计。

主要亮点

  • 灵活部署:支持完整的集群编排,或模块化安装特定组件,如 KubeFlow 或 NFS 存储。
  • 多调度器支持:为 Kubernetes(以容器为中心)和 Slurm(以作业为中心)环境提供自动化路径。
  • DGX 优化:专为 NVIDIA DGX 系统和 DGX OS 量身定制。
  • 广泛的 OS 兼容性:已在 Ubuntu 22.04/24.04 LTS 和 NVIDIA DGX OS 6/7 上验证。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目