MiaAI-Lab/sparkDash

sparkDash ⚡ — Multi-DGX Spark Monitoring Dashboard

解決する課題

sparkDashは、NVIDIA DGX Spark(GB10)マシンおよびNVIDIA GPUを搭載した他のLinuxホスト向けに設計されたリアルタイム監視ダッシュボードです。複数のAIハードウェアユニットを単一のインターフェースで管理するという問題を解決し、GPU、CPU、メモリ、ネットワークパフォーマンス、およびローカルLLMサーバーの健全性とパフォーマンスを可視化します。

仕組み

このシステムは、Node.js/Expressバックエンドを使用して「Sparks」(監視対象ユニット)のレジストリを管理します。ローカルホストの場合はsysfs/procとnvidia-smiを介して、リモートユニットの場合はSSHを介してメトリクスを収集します。WebSocketストリームがこれらのメトリクスをReactベースのフロントエンドにプッシュします。LLMバックエンド(vLLM、llama.cpp、SGLangなど)用の専用プローブと、ComfyUI、Hermes Agent、Tailscaleのオプション統合が含まれており、サービス健全性と接続性を監視します。

対象ユーザー

NVIDIA DGX SparkユニットまたはGPU対応Linuxワークステーションを運用する開発者や研究者を対象としており、ハードウェア使用率の集中監視、LLM推論パフォーマンスのベンチマーク、リモートGPUホストの管理を必要とする方々に適しています。

ハイライト

  • マルチユニット監視: 共有オーバービューで、複数のDGX Sparkまたは標準NVIDIA GPUホストを1つのブラウザウィンドウで追跡できます。
  • LLMパフォーマンスプロービング: さまざまなLLMバックエンドを自動検出し、1秒あたりのデコード/プリフィル トークン数とKVキャッシュ使用量をリアルタイムで報告します。
  • 推論ベンチマーク: マルチ並行デコードおよびコンテキストサイズスイーププリフィルベンチマーク(1k〜300kトークン)用の組み込みツール。
  • サービス統合: ComfyUI(キュー/ジョブステータス)、Hermes Agent(更新チェック)、Tailscale(オフテイルネット検出)のオプション監視。
  • ハードウェア詳細: GB10ユニットの統合メモリを特に追跡し、個別GPUホストのRAMとVRAMを分離します。
  • リモート管理: SSHベースのメトリクス収集、Wake-on-LAN、グレースフルシャットダウンコマンドをサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト