spark-arena/sparkrun
sparkrun - launch, manage, and stop LLM inference workloads on NVIDIA DGX Spark systems
What it solves
解決する課題
LLM 推論ワークロードの NVIDIA DGX Spark システム上でのデプロイと管理を簡素化します。Slurm や Kubernetes のような複雑なオーケストレーターを必要とせず、単一のコマンドで 1 つまたは複数のノードにわたってモデルを起動できるようになります。
How it works
仕組み
Sparkrun は、SSH mesh、sudoers、ネットワークインターフェース検出を含むクラスター構成のためのガイド付きセットアップウィザードを使用します。SSH を介してノード間でモデルとコンテナの配布を管理し、InfiniBand/RDMA を自動検出することでマルチノード・テンソル並列化をサポートします。Git ベースのレジストリから「recipes」を取得して、モデルをどのように実行すべきかを定義します。
Who it’s for
対象ユーザー
従来のクラスター管理ツールのオーバーヘッドなしに、LLM 推論をデプロイするための合理的な方法を求めている NVIDIA DGX Spark ハードウェアを使用する開発者や研究者。
Highlights
ハイライト
- Multi-runtime support: vLLM、SGLang、および llama.cpp と連携します。
- Multi-node tensor parallelism: 自動ネットワーク検出により、複数のホストにわたって簡単にスケールできます。
- VRAM estimation: 起動前にモデルがメモリに収まるかどうかを予測します。
- Git-based recipe registries: 公式、コミュニティ、およびベンチマーク済みのモデル構成にアクセスできます。
- Automated setup: クラスター作成、SSH mesh、およびハードウェア検出のためのガイド付きウィザード。