wentbackward/nv-monitor

Lightweight nVidia telemetry and terminal system monitor - built for any architecture - Jetson, GB10, GB200, H100

何を解決するか

nv-monitor は NVIDIA GPU システム向けの軽量で依存関係のないモニタリングツールです。単一マシンまたはクラスタ上で CPU、GPU、メモリ使用率を高パフォーマンスかつ低オーバーヘッドで追跡する必要がある問題を解決します。特に DGX Spark や GB200 などのハイエンドハードウェアに適しています。

動作方法

C 言語で記述されたこのツールは、/proc および /sys からシステムメトリクスを読み取り、NVIDIA Management Library (NVML) を使用して GPU 固有のデータを収集します。このデータを以下の3つの方法で利用できます:

  1. TUI(ターミナルユーザーインターフェース): 実時間で色分けされたダッシュボード。CPU のコアごとの使用率(ARM big.LITTLE アーキテクチャ対応)、メモリ、GPU 使用率、電力消費、アクティブな GPU プロセスを表示。
  2. CSV ロガー: ヘッドレスモードで、設定可能な間隔ですべての統計情報をファイルにログ出力。
  3. Prometheus エクスポート: OpenMetrics 互換のエンドポイント。Prometheus/Grafana スタックへの統合に使用可能なシステムメトリクスを公開。

対象ユーザー

ARMベースの Grace CPU または高密度 GPU クラスタ(例:H100、GB200)を使用する NVIDIA ベースの Linux サーバーを管理するシステム管理者や ML エンジニア。特に、統合メモリや HugePages の正確なモニタリングが必要な環境に適しています。

特徴

  • 極めて軽量: 80KB未満の単一バイナリで、実行時依存関係なし。
  • ハードウェア固有の最適化: 統合メモリ、HugePages、ARM big.LITTLE コアトポロジーを正しく処理。
  • 柔軟な出力: 実時間 TUI、CSV ロギング、オプションで Bearer トークン認証付きの Prometheus メトリクスエンドポイントをサポート。
  • 広範な互換性: x86_64 および aarch64 アーキテクチャで動作。Jetson Orin からデータセンター用の H100/GB200 システムまで対応。
  • 合成負荷生成ツール: demo-load を内蔵。複雑なベンチマークソフトウェアを必要とせずに、モニタリングパイプラインの検証が可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト