NVIDIA/dcgm-exporter
NVIDIA GPU metrics exporter for Prometheus leveraging DCGM
해결하는 문제
DCGM-Exporter는 Prometheus가 수집하고 시각화할 수 있는 형식(예: Grafana를 통해)으로 GPU 메트릭을 노출함으로써 사용자가 NVIDIA GPU의 성능과 건강 상태를 모니터링할 수 있도록 합니다. NVIDIA의 데이터센터 GPU 매니저(DCGM)와 클라우드 네이티브 모니터링 스택 사이의 격차를 메웁니다.
작동 방식
이 도구는 NVIDIA DCGM을 활용하여 GPU에서 텔레메트리 데이터를 수집합니다. 컨테이너 또는 systemd 서비스로 실행되며, Prometheus가 스카우프할 수 있는 /metrics 엔드포인트를 노출합니다. 베어메탈 또는 Kubernetes 클러스터 내부(일반적으로 NVIDIA GPU Operator의 일부로)에 배포할 수 있습니다.
대상 사용자
데이터센터 또는 Kubernetes 환경에서 GPU 가속 워크로드를 관리하는 시스템 관리자, DevOps 엔지니어, ML 플랫폼 엔지니어를 위한 것입니다.
주요 특징
- Prometheus 통합: GPU 메트릭을 Prometheus로 내보내는 네이티브 지원.
- 유연한 구성: 사용자가 커스텀 CSV 또는 YAML 구성 파일을 통해 수집할 메트릭을 정의할 수 있습니다.
- Kubernetes 호환: Helm 차트를 통해 간편한 배포 및 NVIDIA GPU Operator와의 통합.
- 고급 텔레메트리: SM 클럭 주파수, 메모리 온도, 누적 XID 오류 추적을 지원합니다.
- 컨텍스트 레이블링: 컨테이너 런타임 레이블 및 HPC 작업 매핑을 추가하여 GPU 사용을 특정 작업이나 컨테이너와 연관지을 수 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트