NVIDIA/DCGM

NVIDIA Data Center GPU Manager (DCGM) is a project for gathering telemetry and measuring the health of NVIDIA GPUs

해결하는 문제

NVIDIA Data Center GPU Manager (DCGM)는 대규모 클러스터 환경에서 NVIDIA GPU를 관리하고 모니터링하는 복잡성을 해결합니다. 데이터센터 인프라의 높은 신뢰성과 가용성을 보장하기 위해 중앙 집중식으로 건강 모니터링, 진단, 리소스 거버넌스를 처리할 수 있는 방법을 제공합니다.

작동 방식

DCGM은 텔레메트리 데이터를 수집하고 GPU 상태를 관리하는 데몬으로 작동합니다. 활성 건강 모니터링과 포괄적인 진단을 제공하는 도구 세트를 포함합니다. 인프라 팀용 독립형 도구로 사용할 수 있으며, 더 큰 클러스터 관리 및 리소스 스케줄링 시스템에 통합할 수도 있습니다. 또한 dcgm-exporter를 통해 Kubernetes 생태계와 통합되어 GPU 텔레메트리 데이터를 수집할 수 있습니다.

대상 사용자

데이터센터에서 NVIDIA GPU 클러스터를 관리하는 인프라 팀 및 시스템 관리자, 그리고 클러스터 관리 도구를 개발하는 개발자들입니다.

주요 특징

  • 포괄적인 모니터링: 활성 건강 모니터링 및 시스템 알림 포함.
  • 거버넌스 정책: GPU의 전력 및 클럭 설정을 관리.
  • 진단 기능: GPU 건강 상태를 검증하기 위한 도구 세트 제공.
  • 광범위한 플랫폼 지원: x86_64, Arm, POWER (ppc64le) 아키텍처의 Linux 지원.
  • API 지원: C, Python, Go 언어로 제공되는 라이브러리 및 소스 예제.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트