NVIDIA/DCGM
NVIDIA Data Center GPU Manager (DCGM) is a project for gathering telemetry and measuring the health of NVIDIA GPUs
解決的問題
NVIDIA Data Center GPU Manager (DCGM) 解決了在大型叢集環境中管理與監控 NVIDIA GPU 的複雜性。它提供了一種集中式方式,用於處理健康監控、診斷與資源治理,以確保資料中心基礎設施的高可靠性和高可用性。
作法
DCGM 作為一個守護程序運作,收集遙測資料並管理 GPU 狀態。它提供一整套工具,包括主動健康監控與全面診斷。可作為獨立工具供基礎設施團隊使用,也可整合至更大的叢集管理與資源排程系統中。同時也透過 dcgm-exporter 與 Kubernetes 生態系統整合,以收集 GPU 遙測資料。
適用對象
負責管理資料中心中 NVIDIA GPU 叢集的基礎設施團隊與系統管理員,以及開發叢集管理工具的開發者。
主要特色
- 全面監控:包含主動健康監控與系統警示。
- 治理策略:管理 GPU 的電力與時鐘設定。
- 診斷功能:提供一整套工具用於驗證 GPU 健康狀態。
- 廣泛平台支援:支援 x86_64、Arm 與 POWER(ppc64le)架構的 Linux 系統。
- API 支援:提供 C、Python 與 Go 語言的函式庫與原始碼範例。
相關
- 專案
- 專案
- 專案
- 專案
- 專案