MiaAI-Lab/sparkDash

sparkDash ⚡ — Multi-DGX Spark Monitoring Dashboard

해결하는 문제

sparkDash는 NVIDIA DGX Spark(GB10) 머신 및 NVIDIA GPU가 장착된 기타 Linux 호스트를 위해 설계된 실시간 모니터링 대시보드입니다. 단일 인터페이스에서 여러 AI 하드웨어 유닛을 관리하는 문제를 해결하며, GPU, CPU, 메모리, 네트워크 성능 및 로컬 LLM 서버의 상태와 성능을 시각화합니다.

작동 방식

이 시스템은 Node.js/Express 백엔드를 사용하여 "Sparks"(모니터링 대상 유닛)의 레지스트리를 관리합니다. 로컬 호스트의 경우 sysfs/proc 및 nvidia-smi를 통해, 원격 유닛의 경우 SSH를 통해 메트릭을 수집합니다. WebSocket 스트림이 이러한 메트릭을 React 기반 프론트엔드로 푸시합니다. LLM 백엔드(vLLM, llama.cpp, SGLang 등)용 특수 프로브와 ComfyUI, Hermes Agent, Tailscale용 선택적 통합이 포함되어 서비스 상태와 연결성을 모니터링합니다.

대상 사용자

NVIDIA DGX Spark 유닛 또는 GPU 지원 Linux 워크스테이션을 운영하는 개발자와 연구자를 대상으로 하며, 하드웨어 사용률 중앙 모니터링, LLM 추론 성능 벤치마킹, 원격 GPU 호스트 관리가 필요한 사람들에게 적합합니다.

주요 기능

  • 멀티 유닛 모니터링: 공유 개요로 여러 DGX Spark 또는 표준 NVIDIA GPU 호스트를 하나의 브라우저 창에서 추적할 수 있습니다.
  • LLM 성능 프로빙: 다양한 LLM 백엔드를 자동 감지하여 초당 디코드/프리필 토큰 수와 KV 캐시 사용량을 실시간으로 보고합니다.
  • 추론 벤치마킹: 다중 동시성 디코드 및 컨텍스트 크기 스윕 프리필 벤치마크(1k~300k 토큰)용 내장 도구.
  • 서비스 통합: ComfyUI(큐/작업 상태), Hermes Agent(업데이트 확인), Tailscale(오프테일넷 감지)의 선택적 모니터링.
  • 하드웨어 세부 정보: GB10 유닛의 통합 메모리를 특별히 추적하고 개별 GPU 호스트의 RAM과 VRAM을 분리합니다.
  • 원격 관리: SSH 기반 메트릭 수집, Wake-on-LAN, 정상 종료 명령을 지원합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트