NVIDIA/deepops

Tools for building GPU clusters

解決的問題

DeepOps 簡化了部署與管理 GPU 加速伺服器叢集的複雜流程。它自動化了必要的軟體堆疊(包括驅動程式、容器執行時與叢集管理器)的安裝,讓研究人員與工程師能專注於執行 AI 工作負載,而非手動設定基礎設施。

工作原理

DeepOps 使用 Ansible playbook 來編排 GPU 環境的安裝與設定。根據使用者需求,它可以:

  • 使用 Kubespray 部署完整的 Kubernetes 叢集,用於容器化應用管理。
  • 設定 Slurm 叢集,用於傳統的批次工作排程與資源管理。
  • 在單一機器上安裝必要的 NVIDIA 組件(驅動程式、Docker 與 NVIDIA 容器執行時)。
  • 在支援的系統上部署 NVIDIA DGX 軟體堆疊。

適用對象

專為管理內部部署資料中心、NVIDIA DGX 系統或任何需要高效率 GPU 叢集進行 AI 訓練與推論的裸金屬環境的系統管理員與 ML 工程師所設計。

主要特色

  • 彈性部署:支援完整的叢集編排,或模組化安裝特定元件,如 KubeFlow 或 NFS 儲存。
  • 多排程器支援:提供 Kubernetes(以容器為中心)與 Slurm(以工作為中心)環境的自動化路徑。
  • DGX 最佳化:特別針對 NVIDIA DGX 系統與 DGX OS 設計優化。
  • 廣泛的 OS 相容性:已在 Ubuntu 22.04/24.04 LTS 與 NVIDIA DGX OS 6/7 上驗證。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案