NVIDIA/dcgm-exporter
NVIDIA GPU metrics exporter for Prometheus leveraging DCGM
解決的問題
DCGM-Exporter 允許使用者透過 Prometheus 可收集與視覺化(例如透過 Grafana)的格式,監控 NVIDIA GPU 的效能與健康狀態。它彌補了 NVIDIA 的資料中心 GPU 管理員(DCGM)與雲原生監控堆疊之間的差距。
作法
此工具利用 NVIDIA DCGM 從 GPU 收集遙測資料。以容器或 systemd 服務形式執行,公開一個 /metrics 端點供 Prometheus 抓取。可部署於裸機或 Kubernetes 叢集內(通常作為 NVIDIA GPU Operator 的一部分)。
適用對象
專為在資料中心或 Kubernetes 環境中管理 GPU 加速工作負載的系統管理員、DevOps 工程師與 ML 平台工程師設計。
主要特色
- Prometheus 整合:原生支援將 GPU 指標匯出至 Prometheus。
- 彈性設定:使用者可透過自訂 CSV 或 YAML 設定檔,定義要收集的指標。
- Kubernetes 就緒:可透過 Helm 圖表輕鬆部署,並與 NVIDIA GPU Operator 整合。
- 進階遙測:支援追蹤 SM 時脈頻率、記憶體溫度與累積 XID 錯誤。
- 上下文標籤:可新增容器執行時標籤與 HPC 作業對應,將 GPU 使用狀況關聯至特定作業或容器。
相關
- 專案
- 專案
- 專案
- 專案
- 專案