wentbackward/nv-monitor

Lightweight nVidia telemetry and terminal system monitor - built for any architecture - Jetson, GB10, GB200, H100

解决的问题

nv-monitor 是一个轻量级、无依赖的 NVIDIA GPU 系统监控工具。它解决了在单机或集群环境中,需要一种高性能、低开销的方式来跟踪 CPU、GPU 和内存使用率的问题,尤其适用于 DGX Spark 或 GB200 等高端硬件。

工作原理

该工具使用 C 语言编写,从 /proc/sys 读取系统指标,并利用 NVIDIA 管理库(NVML)获取 GPU 特定数据。它提供了三种主要的数据消费方式:

  1. TUI(终端用户界面): 实时、彩色编码的仪表盘,显示每个核心的 CPU 使用率(包括对 ARM big.LITTLE 架构的支持)、内存、GPU 利用率、功耗以及正在运行的 GPU 进程。
  2. CSV 日志记录器: 无头模式,可按配置间隔将所有统计数据记录到文件中。
  3. Prometheus 导出器: 提供 OpenMetrics 兼容的端点,可将系统指标暴露给 Prometheus/Grafana 堆栈进行集成。

适用人群

管理 NVIDIA 驱动的 Linux 服务器的系统管理员和机器学习工程师,特别是使用 ARM 架构 Grace CPU 或高密度 GPU 集群(如 H100、GB200)的场景,其中需要对统一内存和 HugePages 进行精确监控。

特色亮点

  • 超轻量: 单个二进制文件小于 80KB,无运行时依赖。
  • 硬件特定优化: 正确处理统一内存、HugePages 以及 ARM big.LITTLE 核心拓扑。
  • 灵活输出: 支持实时 TUI、CSV 日志记录,以及可选 Bearer 令牌认证的 Prometheus 指标端点。
  • 广泛兼容: 支持 x86_64 和 aarch64 架构,从 Jetson Orin 到数据中心级 H100/GB200 系统均可运行。
  • 合成负载生成器: 内置 demo-load,无需复杂基准测试软件即可验证监控管道。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目