NVIDIA/deepops
Tools for building GPU clusters
解决的问题
DeepOps 简化了部署和管理 GPU 加速服务器集群的复杂过程。它自动化了必要的软件栈(包括驱动程序、容器运行时和集群管理器)的安装,使研究人员和工程师能够专注于运行 AI 工作负载,而不是手动配置基础设施。
工作原理
DeepOps 使用 Ansible playbook 来编排 GPU 环境的安装和配置。根据用户需求,它可以:
- 使用 Kubespray 部署完整的 Kubernetes 集群,用于容器化应用管理。
- 设置 Slurm 集群,用于传统的批处理作业调度和资源管理。
- 在单台机器上安装必要的 NVIDIA 组件(驱动程序、Docker 和 NVIDIA 容器运行时)。
- 在支持的系统上部署 NVIDIA DGX 软件栈。
适用人群
专为管理本地数据中心、NVIDIA DGX 系统或任何需要高性能 GPU 集群进行 AI 训练和推理的裸金属环境的系统管理员和 ML 工程师设计。
主要亮点
- 灵活部署:支持完整的集群编排,或模块化安装特定组件,如 KubeFlow 或 NFS 存储。
- 多调度器支持:为 Kubernetes(以容器为中心)和 Slurm(以作业为中心)环境提供自动化路径。
- DGX 优化:专为 NVIDIA DGX 系统和 DGX OS 量身定制。
- 广泛的 OS 兼容性:已在 Ubuntu 22.04/24.04 LTS 和 NVIDIA DGX OS 6/7 上验证。
相关
- 项目
- 项目
- 项目
- 项目
- 项目