leptonai/gpud

GPUd automates monitoring, diagnostics, and issue identification for GPUs

解决的问题

GPUd 解决了在大规模 AI/ML 集群中维持 GPU 效率和可靠性的挑战。通过主动监控 GPU 健康状况并管理工作负载,确保硬件处于最佳性能状态,从而防止生产环境停机。

工作原理

GPUd 以轻量级、自包含的二进制文件形式在 Linux 机器上运行。它与 NVIDIA 生态系统(包括 NVML 和 DCGM)以及 Docker、containerd、Kubernetes 等系统工具集成,收集并报告关键指标。它监控 GPU 功率、温度和网络状态,同时扫描硬件性能下降、kmsg 错误和 NVML Xid 事件,以在影响工作负载之前检测故障。

适用人群

专为管理 AI/ML 工作负载的 GPU 集群的工程师和运维人员设计,尤其适用于在生产环境中使用 NVIDIA 硬件或与 DGX Cloud Lepton 集成的场景。

核心亮点

  • GPU 为中心的监控:提供关键 GPU 和 GPU 网络指标的统一视图。
  • 生产环境验证:已在 DGX Cloud Lepton 的生产基础设施中投入使用。
  • 低开销:设计上将监控置于工作负载的关键路径之外,以最小化 CPU 和内存使用。
  • 灵活部署:支持通过 systemd 直接安装到主机、前台/后台运行,以及通过 Helm Chart 在 Kubernetes 中部署。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目