psalias2006/gpu-hot

🔥 Real-time NVIDIA GPU dashboard

해결하는 문제

GPU Hot은 NVIDIA GPU를 실시간으로 모니터링하기 위한 가벼운 셀프 호스팅 대시보드를 제공합니다. 단일 머신 또는 전체 GPU 서버 클러스터에 걸쳐 하드웨어 메트릭과 프로세스 사용량을 추적할 수 있는 웹 기반 인터페이스를 제공하여 복잡한 모니터링 설정의 필요성을 제거합니다.

작동 원리

이 도구는 FastAPI 백엔드를 사용하여 NVML (NVIDIA Management Library) 또는 이전 하드웨어의 경우 nvidia-smi를 폴백으로 사용하여 메트릭을 수집합니다. 이 데이터는 WebSockets를 통해 웹 프런트엔드로 실시간 전송되어 히스토리 차트와 상태 카드를 렌더링합니다. 멀티 노드 설정의 경우, 중앙 허브 어그리게이터가 여러 원격 GPU 노드에서 데이터를 수집하고 표시하는 "허브 모드"로 작동할 수 있습니다.

대상 사용자

모델 학습 또는 추론 중에 GPU 사용률, 온도 및 전력 소모를 모니터링해야 하는 개발자, ML 엔지니어 및 시스템 관리자에게 적합하며, 특히 여러 GPU 서버를 관리할 때 유용합니다.

주요 특징

  • 실시간 모니터링: 사용률, 온도, 메모리 및 전력 소모에 대한 초 단위 미만의 메트릭 업데이트.
  • 클러스터 확장성: 허브 앤 스포크(hub-and-spoke) 아키텍처를 사용하여 단일 GPU에서 여러 노드에 걸친 100개 이상의 GPU까지 확장 가능.
  • 프로세스 추적: PID 및 메모리 사용량을 포함한 활성 GPU 프로세스 모니터링.
  • 시스템 통합: GPU 데이터와 함께 CPU, RAM, swap 및 디스크 사용량과 같은 호스트 수준의 메트릭 추적.
  • 효율적인 리소스 사용: CPU 오버헤드를 최소화하기 위해 클라이언트가 연결되지 않은 경우 폴링을 자동으로 일시 중지.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트