leptonai/gpud
GPUd automates monitoring, diagnostics, and issue identification for GPUs
解決的問題
GPUd 解決了在大型 AI/ML 集群中維持 GPU 效率與可靠性的挑戰。透過主動監控 GPU 健康狀態並管理工作負載,確保硬體處於最佳性能,從而防止生產環境停機。
工作原理
GPUd 以輕量級、自我封裝的二進位檔形式在 Linux 機器上執行。它與 NVIDIA 生態系統(包含 NVML 與 DCGM)以及 Docker、containerd、Kubernetes 等系統工具整合,收集並報告關鍵指標。它監控 GPU 電力、溫度與網路狀態,同時掃描硬體效能下降、kmsg 錯誤與 NVML Xid 事件,以在影響工作負載前偵測故障。
適用對象
專為管理 AI/ML 工作負載的 GPU 集群之工程師與運維人員設計,特別適用於在生產環境中使用 NVIDIA 硬體或與 DGX Cloud Lepton 整合的場景。
核心亮點
- 以 GPU 為中心的監控:提供關鍵 GPU 與 GPU 網路指標的統一視圖。
- 生產環境驗證:已在 DGX Cloud Lepton 的生產基礎設施中投入使用。
- 低開銷:設計上將監控置於工作負載的關鍵路徑之外,以最小化 CPU 與記憶體使用。
- 彈性部署:支援透過 systemd 直接安裝至主機、前臺/背景執行,以及透過 Helm Chart 在 Kubernetes 中部署。
相關
- 專案
- 專案
- 專案
- 專案
- 專案