NVIDIA/dcgm-exporter
NVIDIA GPU metrics exporter for Prometheus leveraging DCGM
解决的问题
DCGM-Exporter 允许用户通过以 Prometheus 可收集和可视化(例如通过 Grafana)的格式暴露 GPU 指标,来监控 NVIDIA GPU 的性能和健康状况。它弥合了 NVIDIA 的数据中心 GPU 管理器(DCGM)与云原生监控栈之间的差距。
工作原理
该工具利用 NVIDIA DCGM 从 GPU 收集遥测数据。它以容器或 systemd 服务的形式运行,暴露一个 /metrics 端点供 Prometheus 抓取。它可以部署在裸金属服务器上,或在 Kubernetes 集群中(通常作为 NVIDIA GPU Operator 的一部分)。
适用人群
专为在数据中心或 Kubernetes 环境中管理 GPU 加速工作负载的系统管理员、DevOps 工程师和 ML 平台工程师设计。
主要亮点
- Prometheus 集成:原生支持将 GPU 指标导出至 Prometheus。
- 灵活配置:用户可通过自定义 CSV 或 YAML 配置文件定义要收集的指标。
- Kubernetes 就绪:可通过 Helm 图表轻松部署,并与 NVIDIA GPU Operator 集成。
- 高级遥测:支持跟踪 SM 时钟频率、内存温度和累计 XID 错误。
- 上下文标签:支持添加容器运行时标签和 HPC 作业映射,将 GPU 使用情况与特定作业或容器关联。
相关
- 项目
- 项目
- 项目
- 项目
- 项目