psalias2006/gpu-hot
🔥 Real-time NVIDIA GPU dashboard
解决的问题
GPU Hot 提供了一个轻量级的自托管仪表盘,用于实时监控 NVIDIA GPU。它通过提供基于 Web 的界面来跟踪单台机器或整个 GPU 服务器集群的硬件指标和进程使用情况,消除了复杂监控设置的需要。
工作原理
该工具使用 FastAPI 后端,通过 NVML (NVIDIA Management Library) 或针对旧硬件的 nvidia-smi 回退方案来收集指标。它通过 WebSockets 将这些数据实时传输到 Web 前端,用于渲染历史图表和状态卡片。对于多节点设置,它可以运行在“中心模式 (hub mode)”下,由一个中央中心聚合器收集并显示来自多个远程 GPU 节点的数据。
适用对象
专为需要在模型训练或推理期间监控 GPU 利用率、温度和功耗的开发人员、机器学习工程师和系统管理员设计,尤其是在管理多个 GPU 服务器时。
亮点
- 实时监控:利用率、温度、内存和功耗的亚秒级指标更新。
- 集群扩展:利用中心辐射型 (hub-and-spoke) 架构,实现从单个 GPU 到跨多个节点的 100 多个 GPU 的扩展能力。
- 进程追踪:监控活动的 GPU 进程,包括 PID 和内存使用情况。
- 系统集成:在跟踪 GPU 数据的同时,跟踪 CPU、RAM、swap 和磁盘使用情况等主机级指标。
- 高效资源利用:在没有客户端连接时自动暂停轮询,以最大限度地减少 CPU 开销。
相关
- 项目
- 项目
- 项目
- 项目
- 项目