NVIDIA/deepops
Tools for building GPU clusters
해결하는 문제
DeepOps는 GPU 가속 서버 클러스터를 배포하고 관리하는 복잡한 과정을 단순화합니다. 드라이버, 컨테이너 런타임, 클러스터 관리자 등 필요한 소프트웨어 스택의 설치를 자동화하여 연구자와 엔지니어가 수동적인 인프라 구성에 시간을 쓰지 않고 AI 워크로드 실행에 집중할 수 있도록 합니다.
작동 방식
DeepOps는 Ansible 플레이북을 사용하여 GPU 환경의 설치 및 구성 작업을 오케스트레이션합니다. 사용자의 필요에 따라 다음 기능을 제공합니다:
- Kubespray를 사용하여 컨테이너 기반 애플리케이션 관리를 위한 완전한 Kubernetes 클러스터를 배포.
- 전통적인 배치 작업 스케줄링 및 리소스 관리를 위한 Slurm 클러스터를 설정.
- 단일 머신에 필수적인 NVIDIA 구성 요소(드라이버, Docker, NVIDIA 컨테이너 런타임)를 설치.
- 지원되는 시스템에 NVIDIA DGX 소프트웨어 스택을 배포.
대상 사용자
온프레미스 데이터센터, NVIDIA DGX 시스템, 또는 AI 학습 및 추론에 고성능 GPU 클러스터가 필요한 베어메탈 환경을 관리하는 시스템 관리자 및 ML 엔지니어를 위한 것입니다.
주요 특징
- 유연한 배포: 전체 클러스터 오케스트레이션 또는 KubeFlow 또는 NFS 스토리지와 같은 특정 구성 요소의 모듈식 설치를 지원합니다.
- 다중 스케줄러 지원: Kubernetes(컨테이너 중심) 및 Slurm(작업 중심) 환경 모두에 대한 자동화된 경로를 제공합니다.
- DGX 최적화: NVIDIA DGX 시스템 및 DGX OS에 특별히 최적화되어 있습니다.
- 광범위한 OS 호환성: Ubuntu 22.04/24.04 LTS 및 NVIDIA DGX OS 6/7에서 검증되었습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트