wentbackward/nv-monitor
Lightweight nVidia telemetry and terminal system monitor - built for any architecture - Jetson, GB10, GB200, H100
解決的問題
nv-monitor 是一款輕量級、無依賴的 NVIDIA GPU 系統監控工具。它解決了在單機或叢集環境中,需要一種高效率、低開銷方式追蹤 CPU、GPU 和記憶體使用率的問題,特別適用於 DGX Spark 或 GB200 等高階硬體。
工作原理
此工具以 C 語言撰寫,從 /proc 和 /sys 讀取系統指標,並使用 NVIDIA 管理庫(NVML)取得 GPU 特定資料。它提供三種主要的資料消費方式:
- TUI(終端使用者介面): 實時、彩色編碼的儀表板,顯示每個核心的 CPU 使用率(包含對 ARM big.LITTLE 架構的支援)、記憶體、GPU 使用率、功耗以及正在執行的 GPU 進程。
- CSV 日誌記錄器: 無頭模式,可依設定間隔將所有統計資料記錄至檔案中。
- Prometheus 導出器: 提供 OpenMetrics 相容的端點,可將系統指標公開給 Prometheus/Grafana 堆疊進行整合。
適用對象
管理 NVIDIA 驅動的 Linux 伺服器的系統管理員與機器學習工程師,特別是使用 ARM 架構 Grace CPU 或高密度 GPU 叢集(如 H100、GB200)的場景,其中需要對統一記憶體與 HugePages 進行精確監控。
特色亮點
- 超輕量: 單一二進位檔小於 80KB,無執行時依賴。
- 硬體特定優化: 正確處理統一記憶體、HugePages 以及 ARM big.LITTLE 核心拓撲。
- 靈活輸出: 支援即時 TUI、CSV 日誌記錄,以及可選 Bearer 令牌認證的 Prometheus 指標端點。
- 廣泛相容: 支援 x86_64 與 aarch64 架構,從 Jetson Orin 到資料中心級 H100/GB200 系統皆可運作。
- 合成負載產生器: 內建
demo-load,無需複雜的基準測試軟體即可驗證監控管道。
相關
- 專案
- 專案
- 專案
- 專案
- 專案