NVIDIA/dcgm-exporter

NVIDIA GPU metrics exporter for Prometheus leveraging DCGM

해결하는 문제

DCGM-Exporter는 Prometheus가 수집하고 시각화할 수 있는 형식(예: Grafana를 통해)으로 GPU 메트릭을 노출함으로써 사용자가 NVIDIA GPU의 성능과 건강 상태를 모니터링할 수 있도록 합니다. NVIDIA의 데이터센터 GPU 매니저(DCGM)와 클라우드 네이티브 모니터링 스택 사이의 격차를 메웁니다.

작동 방식

이 도구는 NVIDIA DCGM을 활용하여 GPU에서 텔레메트리 데이터를 수집합니다. 컨테이너 또는 systemd 서비스로 실행되며, Prometheus가 스카우프할 수 있는 /metrics 엔드포인트를 노출합니다. 베어메탈 또는 Kubernetes 클러스터 내부(일반적으로 NVIDIA GPU Operator의 일부로)에 배포할 수 있습니다.

대상 사용자

데이터센터 또는 Kubernetes 환경에서 GPU 가속 워크로드를 관리하는 시스템 관리자, DevOps 엔지니어, ML 플랫폼 엔지니어를 위한 것입니다.

주요 특징

  • Prometheus 통합: GPU 메트릭을 Prometheus로 내보내는 네이티브 지원.
  • 유연한 구성: 사용자가 커스텀 CSV 또는 YAML 구성 파일을 통해 수집할 메트릭을 정의할 수 있습니다.
  • Kubernetes 호환: Helm 차트를 통해 간편한 배포 및 NVIDIA GPU Operator와의 통합.
  • 고급 텔레메트리: SM 클럭 주파수, 메모리 온도, 누적 XID 오류 추적을 지원합니다.
  • 컨텍스트 레이블링: 컨테이너 런타임 레이블 및 HPC 작업 매핑을 추가하여 GPU 사용을 특정 작업이나 컨테이너와 연관지을 수 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트