wentbackward/nv-monitor

Lightweight nVidia telemetry and terminal system monitor - built for any architecture - Jetson, GB10, GB200, H100

解決的問題

nv-monitor 是一款輕量級、無依賴的 NVIDIA GPU 系統監控工具。它解決了在單機或叢集環境中,需要一種高效率、低開銷方式追蹤 CPU、GPU 和記憶體使用率的問題,特別適用於 DGX Spark 或 GB200 等高階硬體。

工作原理

此工具以 C 語言撰寫,從 /proc/sys 讀取系統指標,並使用 NVIDIA 管理庫(NVML)取得 GPU 特定資料。它提供三種主要的資料消費方式:

  1. TUI(終端使用者介面): 實時、彩色編碼的儀表板,顯示每個核心的 CPU 使用率(包含對 ARM big.LITTLE 架構的支援)、記憶體、GPU 使用率、功耗以及正在執行的 GPU 進程。
  2. CSV 日誌記錄器: 無頭模式,可依設定間隔將所有統計資料記錄至檔案中。
  3. Prometheus 導出器: 提供 OpenMetrics 相容的端點,可將系統指標公開給 Prometheus/Grafana 堆疊進行整合。

適用對象

管理 NVIDIA 驅動的 Linux 伺服器的系統管理員與機器學習工程師,特別是使用 ARM 架構 Grace CPU 或高密度 GPU 叢集(如 H100、GB200)的場景,其中需要對統一記憶體與 HugePages 進行精確監控。

特色亮點

  • 超輕量: 單一二進位檔小於 80KB,無執行時依賴。
  • 硬體特定優化: 正確處理統一記憶體、HugePages 以及 ARM big.LITTLE 核心拓撲。
  • 靈活輸出: 支援即時 TUI、CSV 日誌記錄,以及可選 Bearer 令牌認證的 Prometheus 指標端點。
  • 廣泛相容: 支援 x86_64 與 aarch64 架構,從 Jetson Orin 到資料中心級 H100/GB200 系統皆可運作。
  • 合成負載產生器: 內建 demo-load,無需複雜的基準測試軟體即可驗證監控管道。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案