NVIDIA/dcgm-exporter
NVIDIA GPU metrics exporter for Prometheus leveraging DCGM
何を解決するか
DCGM-Exporter は、NVIDIA GPU のパフォーマンスと健全性を監視できるようにし、Prometheus が収集・可視化できる形式(例:Grafana など)で GPU メトリクスを公開します。NVIDIA のデータセンタ GPU マネージャー(DCGM)とクラウドネイティブ監視スタックの間のギャップを埋めます。
動作方法
このツールは NVIDIA DCGM を活用して GPU からのテレメトリデータを収集します。コンテナまたは systemd サービスとして実行され、Prometheus がスクラップする /metrics エンドポイントを公開します。ベアメタルまたは Kubernetes クラスタ内(通常は NVIDIA GPU Operator の一部として)にデプロイできます。
対象ユーザー
データセンターまたは Kubernetes 環境で GPU 加速ワークロードを管理するシステム管理者、DevOps エンジニア、ML プラットフォームエンジニア向けに設計されています。
主な特徴
- Prometheus 連携: GPU メトリクスを Prometheus にエクスポートするネイティブサポート。
- 柔軟な設定: カスタム CSV または YAML 設定ファイルで収集するメトリクスを定義可能。
- Kubernetes 対応: Helm チャートによる簡単なデプロイと NVIDIA GPU Operator との統合。
- 高度なテレメトリ: SM クロック周波数、メモリ温度、累積 XID エラーの追跡をサポート。
- コンテキストラベル: コンテナランタイムラベルや HPC ジョブマッピングを追加し、GPU 使用状況を特定のジョブやコンテナに関連付けることが可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト