wentbackward/nv-monitor
Lightweight nVidia telemetry and terminal system monitor - built for any architecture - Jetson, GB10, GB200, H100
何を解決するか
nv-monitor は NVIDIA GPU システム向けの軽量で依存関係のないモニタリングツールです。単一マシンまたはクラスタ上で CPU、GPU、メモリ使用率を高パフォーマンスかつ低オーバーヘッドで追跡する必要がある問題を解決します。特に DGX Spark や GB200 などのハイエンドハードウェアに適しています。
動作方法
C 言語で記述されたこのツールは、/proc および /sys からシステムメトリクスを読み取り、NVIDIA Management Library (NVML) を使用して GPU 固有のデータを収集します。このデータを以下の3つの方法で利用できます:
- TUI(ターミナルユーザーインターフェース): 実時間で色分けされたダッシュボード。CPU のコアごとの使用率(ARM big.LITTLE アーキテクチャ対応)、メモリ、GPU 使用率、電力消費、アクティブな GPU プロセスを表示。
- CSV ロガー: ヘッドレスモードで、設定可能な間隔ですべての統計情報をファイルにログ出力。
- Prometheus エクスポート: OpenMetrics 互換のエンドポイント。Prometheus/Grafana スタックへの統合に使用可能なシステムメトリクスを公開。
対象ユーザー
ARMベースの Grace CPU または高密度 GPU クラスタ(例:H100、GB200)を使用する NVIDIA ベースの Linux サーバーを管理するシステム管理者や ML エンジニア。特に、統合メモリや HugePages の正確なモニタリングが必要な環境に適しています。
特徴
- 極めて軽量: 80KB未満の単一バイナリで、実行時依存関係なし。
- ハードウェア固有の最適化: 統合メモリ、HugePages、ARM big.LITTLE コアトポロジーを正しく処理。
- 柔軟な出力: 実時間 TUI、CSV ロギング、オプションで Bearer トークン認証付きの Prometheus メトリクスエンドポイントをサポート。
- 広範な互換性: x86_64 および aarch64 アーキテクチャで動作。Jetson Orin からデータセンター用の H100/GB200 システムまで対応。
- 合成負荷生成ツール:
demo-loadを内蔵。複雑なベンチマークソフトウェアを必要とせずに、モニタリングパイプラインの検証が可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト