leptonai/gpud
GPUd automates monitoring, diagnostics, and issue identification for GPUs
해결하는 문제
GPUd는 대규모 AI/ML 클러스터에서 GPU의 효율성과 신뢰성을 유지하는 데 있어 발생하는 과제를 해결합니다. GPU의 건강 상태를 능동적으로 모니터링하고 워크로드를 관리하여 하드웨어가 최적의 성능을 발휘하도록 하여 생산 환경의 다운타임을 방지합니다.
작동 방식
GPUd는 Linux 머신에서 가벼운, 자체 포함형 바이너리로 실행됩니다. NVIDIA 생태계(NVML 및 DCGM 포함) 및 Docker, containerd, Kubernetes와 같은 시스템 도구와 통합되어 중요한 메트릭을 수집하고 보고합니다. GPU 전력, 온도, 패브릭 상태를 모니터링하며, 하드웨어 성능 저하, kmsg 오류, NVML Xid 이벤트를 스캔하여 워크로드에 영향을 미치기 전에 실패를 탐지합니다.
대상 사용자
AI/ML 워크로드를 위한 GPU 클러스터를 관리하는 엔지니어 및 운영자에게 적합합니다. 특히 NVIDIA 하드웨어를 본격적으로 사용하거나 DGX Cloud Lepton과 통합하는 환경에서 사용됩니다.
주요 특징
- GPU 중심 모니터링: 핵심 GPU 및 GPU 패브릭 메트릭을 통합된 시각으로 제공합니다.
- 본격적인 생산 환경 검증: DGX Cloud Lepton의 생산 인프라에서 사용되고 있습니다.
- 낮은 오버헤드: 워크로드의 핵심 경로에서 모니터링을 제외하도록 설계되어 CPU 및 메모리 사용량을 최소화합니다.
- 유연한 배포: systemd를 통한 직접 호스트 설치, 포그라운드/백그라운드 실행, Helm 차트를 통한 Kubernetes 배포를 지원합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트