MiaAI-Lab/sparkDash

sparkDash ⚡ — Multi-DGX Spark Monitoring Dashboard

解决的问题

sparkDash 是一个专为 NVIDIA DGX Spark (GB10) 机器和其他配备 NVIDIA GPU 的 Linux 主机设计的实时监控仪表板。它解决了在单一界面中管理多个 AI 硬件单元的问题,提供 GPU、CPU、内存和网络性能以及本地 LLM 服务器健康和性能的可视化。

工作原理

该系统使用 Node.js/Express 后端来管理“Sparks”(受监控单元)的注册表。它通过 sysfs/proc 和 nvidia-smi 收集本地主机的指标,通过 SSH 收集远程单元的指标。WebSocket 流将这些指标推送到基于 React 的前端。它包含针对 LLM 后端(如 vLLM、llama.cpp 和 SGLang)的专用探针,以及用于 ComfyUI、Hermes Agent 和 Tailscale 的可选集成,以监控服务健康和连接性。

适用对象

适用于操作 NVIDIA DGX Spark 单元或支持 GPU 的 Linux 工作站的开发人员和研究人员,他们需要一种集中方式来监控硬件利用率、基准测试 LLM 推理性能和管理远程 GPU 主机。

亮点

  • 多单元监控:在共享概览中,通过一个浏览器窗口跟踪多个 DGX Spark 或标准 NVIDIA GPU 主机。
  • LLM 性能探测:自动检测各种 LLM 后端,实时报告每秒解码/预填充 token 数和 KV 缓存使用量。
  • 推理基准测试:内置工具,用于多并发解码和上下文大小扫描预填充基准测试(1k 到 300k token)。
  • 服务集成:可选监控 ComfyUI(队列/作业状态)、Hermes Agent(更新检查)和 Tailscale(脱离 tailnet 检测)。
  • 硬件细节:专门跟踪 GB10 单元的统一内存,并将独立 GPU 主机的 RAM 与 VRAM 分开。
  • 远程管理:支持基于 SSH 的指标收集、Wake-on-LAN 和优雅关机命令。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目