MiaAI-Lab/sparkDash
sparkDash ⚡ — Multi-DGX Spark Monitoring Dashboard
解決的問題
sparkDash 是一個專為 NVIDIA DGX Spark (GB10) 機器和其他配備 NVIDIA GPU 的 Linux 主機設計的即時監控儀表板。它解決了在單一介面中管理多個 AI 硬體單元的問題,提供 GPU、CPU、記憶體和網路效能以及本機 LLM 伺服器健康和效能的視覺化。
運作方式
該系統使用 Node.js/Express 後端來管理「Sparks」(受監控單元)的註冊表。它透過 sysfs/proc 和 nvidia-smi 收集本機主機的指標,透過 SSH 收集遠端單元的指標。WebSocket 串流將這些指標推送到基於 React 的前端。它包含針對 LLM 後端(如 vLLM、llama.cpp 和 SGLang)的專用探針,以及用於 ComfyUI、Hermes Agent 和 Tailscale 的選用整合,以監控服務健康和連線性。
適用對象
適用於操作 NVIDIA DGX Spark 單元或支援 GPU 的 Linux 工作站的開發人員和研究人員,他們需要一種集中方式來監控硬體使用率、基準測試 LLM 推論效能和管理遠端 GPU 主機。
亮點
- 多單元監控:在共享概覽中,透過一個瀏覽器視窗追蹤多個 DGX Spark 或標準 NVIDIA GPU 主機。
- LLM 效能探測:自動偵測各種 LLM 後端,即時報告每秒解碼/預填充 token 數和 KV 快取使用量。
- 推論基準測試:內建工具,用於多並行解碼和上下文大小掃描預填充基準測試(1k 到 300k token)。
- 服務整合:選用監控 ComfyUI(佇列/作業狀態)、Hermes Agent(更新檢查)和 Tailscale(脫離 tailnet 偵測)。
- 硬體細節:專門追蹤 GB10 單元的統一記憶體,並將獨立 GPU 主機的 RAM 與 VRAM 分開。
- 遠端管理:支援基於 SSH 的指標收集、Wake-on-LAN 和優雅關機命令。
相關
- 專案
- 專案
- 專案
- 專案
- 專案