NVIDIA/dcgm-exporter

NVIDIA GPU metrics exporter for Prometheus leveraging DCGM

何を解決するか

DCGM-Exporter は、NVIDIA GPU のパフォーマンスと健全性を監視できるようにし、Prometheus が収集・可視化できる形式(例:Grafana など)で GPU メトリクスを公開します。NVIDIA のデータセンタ GPU マネージャー(DCGM)とクラウドネイティブ監視スタックの間のギャップを埋めます。

動作方法

このツールは NVIDIA DCGM を活用して GPU からのテレメトリデータを収集します。コンテナまたは systemd サービスとして実行され、Prometheus がスクラップする /metrics エンドポイントを公開します。ベアメタルまたは Kubernetes クラスタ内(通常は NVIDIA GPU Operator の一部として)にデプロイできます。

対象ユーザー

データセンターまたは Kubernetes 環境で GPU 加速ワークロードを管理するシステム管理者、DevOps エンジニア、ML プラットフォームエンジニア向けに設計されています。

主な特徴

  • Prometheus 連携: GPU メトリクスを Prometheus にエクスポートするネイティブサポート。
  • 柔軟な設定: カスタム CSV または YAML 設定ファイルで収集するメトリクスを定義可能。
  • Kubernetes 対応: Helm チャートによる簡単なデプロイと NVIDIA GPU Operator との統合。
  • 高度なテレメトリ: SM クロック周波数、メモリ温度、累積 XID エラーの追跡をサポート。
  • コンテキストラベル: コンテナランタイムラベルや HPC ジョブマッピングを追加し、GPU 使用状況を特定のジョブやコンテナに関連付けることが可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト