wentbackward/nv-monitor
Lightweight nVidia telemetry and terminal system monitor - built for any architecture - Jetson, GB10, GB200, H100
해결하는 문제
nv-monitor는 NVIDIA GPU 시스템을 위한 가벼운, 의존성 없는 모니터링 도구입니다. 단일 머신 또는 클러스터에서 CPU, GPU, 메모리 사용률을 고성능이고 저오버헤드로 추적해야 하는 문제를 해결합니다. 특히 DGX Spark나 GB200과 같은 고성능 하드웨어에 적합합니다.
작동 방식
C로 작성된 이 도구는 /proc와 /sys에서 시스템 메트릭을 읽고, NVIDIA Management Library (NVML)를 사용하여 GPU 전용 데이터를 수집합니다. 이 데이터를 다음과 같은 세 가지 방식으로 활용할 수 있습니다:
- TUI (터미널 사용자 인터페이스): 실시간으로 색상 구분된 대시보드로, ARM big.LITTLE 아키텍처 지원 포함한 코어별 CPU 사용률, 메모리, GPU 사용률, 전력 소비, 활성 GPU 프로세스를 표시합니다.
- CSV 로거: 헤드리스 모드로 설정된 간격에 따라 모든 통계를 파일에 로깅합니다.
- Prometheus 에크스포터: OpenMetrics 호환 엔드포인트로, Prometheus/Grafana 스택에 통합할 수 있는 시스템 메트릭을 공개합니다.
대상 사용자
ARM 기반 Grace CPU 또는 고밀도 GPU 클러스터(예: H100, GB200)를 사용하는 NVIDIA 기반 Linux 서버를 관리하는 시스템 관리자 및 ML 엔지니어. 특히 통합 메모리와 HugePages의 정밀한 모니터링이 필요한 환경에 적합합니다.
주요 특징
- 초경량: 런타임 의존성이 없고, 80KB 미만의 단일 바이너리.
- 하드웨어 전용 최적화: 통합 메모리, HugePages, ARM big.LITTLE 코어 토폴로지 정확히 처리.
- 유연한 출력: 실시간 TUI, CSV 로깅, Bearer 토큰 인증이 가능한 옵션으로 Prometheus 메트릭 엔드포인트 지원.
- 광범위한 호환성: x86_64 및 aarch64 아키텍처에서 작동하며, Jetson Orin부터 데이터센터급 H100/GB200 시스템까지 지원.
- 합성 부하 생성기: 복잡한 벤치마크 소프트웨어 없이 모니터링 파이프라인을 검증할 수 있는
demo-load포함.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트