NVIDIA/DCGM

NVIDIA Data Center GPU Manager (DCGM) is a project for gathering telemetry and measuring the health of NVIDIA GPUs

解决的问题

NVIDIA 数据中心 GPU 管理器(DCGM)解决了在大规模集群环境中管理与监控 NVIDIA GPU 的复杂性。它提供了一种集中式方法,用于处理健康监控、诊断和资源治理,以确保数据中心基础设施的高可靠性和高可用性。

工作原理

DCGM 作为一个守护进程运行,收集遥测数据并管理 GPU 状态。它提供了一套工具,包括主动健康监控和全面的诊断功能。它可以作为独立工具供基础设施团队使用,也可以集成到更大的集群管理与资源调度系统中。它还通过 dcgm-exporter 与 Kubernetes 生态系统集成,以收集 GPU 遥测数据。

适用人群

负责管理数据中心中 NVIDIA GPU 集群的基础设施团队和系统管理员,以及开发集群管理工具的开发者。

主要亮点

  • 全面监控:包含主动健康监控和系统告警。
  • 治理策略:管理 GPU 的功耗和时钟设置。
  • 诊断功能:提供一系列工具用于验证 GPU 健康状态。
  • 广泛平台支持:支持 x86_64、Arm 和 POWER(ppc64le)架构的 Linux 系统。
  • API 支持:提供 C、Python 和 Go 语言的库和源码示例。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目