MiaAI-Lab/sparkDash
sparkDash ⚡ — Multi-DGX Spark Monitoring Dashboard
解決する課題
sparkDashは、NVIDIA DGX Spark(GB10)マシンおよびNVIDIA GPUを搭載した他のLinuxホスト向けに設計されたリアルタイム監視ダッシュボードです。複数のAIハードウェアユニットを単一のインターフェースで管理するという問題を解決し、GPU、CPU、メモリ、ネットワークパフォーマンス、およびローカルLLMサーバーの健全性とパフォーマンスを可視化します。
仕組み
このシステムは、Node.js/Expressバックエンドを使用して「Sparks」(監視対象ユニット)のレジストリを管理します。ローカルホストの場合はsysfs/procとnvidia-smiを介して、リモートユニットの場合はSSHを介してメトリクスを収集します。WebSocketストリームがこれらのメトリクスをReactベースのフロントエンドにプッシュします。LLMバックエンド(vLLM、llama.cpp、SGLangなど)用の専用プローブと、ComfyUI、Hermes Agent、Tailscaleのオプション統合が含まれており、サービス健全性と接続性を監視します。
対象ユーザー
NVIDIA DGX SparkユニットまたはGPU対応Linuxワークステーションを運用する開発者や研究者を対象としており、ハードウェア使用率の集中監視、LLM推論パフォーマンスのベンチマーク、リモートGPUホストの管理を必要とする方々に適しています。
ハイライト
- マルチユニット監視: 共有オーバービューで、複数のDGX Sparkまたは標準NVIDIA GPUホストを1つのブラウザウィンドウで追跡できます。
- LLMパフォーマンスプロービング: さまざまなLLMバックエンドを自動検出し、1秒あたりのデコード/プリフィル トークン数とKVキャッシュ使用量をリアルタイムで報告します。
- 推論ベンチマーク: マルチ並行デコードおよびコンテキストサイズスイーププリフィルベンチマーク(1k〜300kトークン)用の組み込みツール。
- サービス統合: ComfyUI(キュー/ジョブステータス)、Hermes Agent(更新チェック)、Tailscale(オフテイルネット検出)のオプション監視。
- ハードウェア詳細: GB10ユニットの統合メモリを特に追跡し、個別GPUホストのRAMとVRAMを分離します。
- リモート管理: SSHベースのメトリクス収集、Wake-on-LAN、グレースフルシャットダウンコマンドをサポート。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト