NVIDIA/gpu-operator
NVIDIA GPU Operator creates, configures, and manages GPUs in Kubernetes
해결하는 문제
Kubernetes 노드에서 NVIDIA GPU 소프트웨어를 수동으로 구성하고 관리하는 오류가 발생하기 쉬운 과정을 제거합니다. 각 GPU 노드에 특수한 OS 이미지를 준비할 필요 없이, 표준 OS 이미지를 사용하고 필요한 드라이버 및 런타임을 자동으로 배포할 수 있습니다.
작동 방식
Kubernetes operator 프레임워크를 사용하여 모든 필요한 NVIDIA 소프트웨어 컴포넌트의 라이프사이클을 자동화합니다. NVIDIA 드라이버(CUDA용), GPU용 Kubernetes 디바이스 플러그인, NVIDIA 컨테이너 런타임, DCGM 기반 모니터링을 컨테이너로 배포하며, 자동 노드 레이블링도 처리합니다.
대상 사용자
클라우드 또는 온프레미스 환경에서 수동으로 하위 소프트웨어 스택을 관리하지 않고도 GPU 노드를 신속하게 프로비저닝하고 확장해야 하는 Kubernetes 클러스터 관리자.
주요 기능
- NVIDIA 드라이버, 컨테이너 런타임, 디바이스 플러그인 설치를 자동화.
- CPU 및 GPU 노드 모두에서 표준 OS 이미지를 사용 가능.
- 소프트웨어를 컨테이너로 실행하여 컴포넌트 업데이트 및 교체를 간소화.
- DCGM를 통한 통합 모니터링 제공.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트