spark-arena/sparkrun

sparkrun - launch, manage, and stop LLM inference workloads on NVIDIA DGX Spark systems

What it solves

解決する課題

LLM 推論ワークロードの NVIDIA DGX Spark システム上でのデプロイと管理を簡素化します。Slurm や Kubernetes のような複雑なオーケストレーターを必要とせず、単一のコマンドで 1 つまたは複数のノードにわたってモデルを起動できるようになります。

How it works

仕組み

Sparkrun は、SSH mesh、sudoers、ネットワークインターフェース検出を含むクラスター構成のためのガイド付きセットアップウィザードを使用します。SSH を介してノード間でモデルとコンテナの配布を管理し、InfiniBand/RDMA を自動検出することでマルチノード・テンソル並列化をサポートします。Git ベースのレジストリから「recipes」を取得して、モデルをどのように実行すべきかを定義します。

Who it’s for

対象ユーザー

従来のクラスター管理ツールのオーバーヘッドなしに、LLM 推論をデプロイするための合理的な方法を求めている NVIDIA DGX Spark ハードウェアを使用する開発者や研究者。

Highlights

ハイライト

  • Multi-runtime support: vLLM、SGLang、および llama.cpp と連携します。
  • Multi-node tensor parallelism: 自動ネットワーク検出により、複数のホストにわたって簡単にスケールできます。
  • VRAM estimation: 起動前にモデルがメモリに収まるかどうかを予測します。
  • Git-based recipe registries: 公式、コミュニティ、およびベンチマーク済みのモデル構成にアクセスできます。
  • Automated setup: クラスター作成、SSH mesh、およびハードウェア検出のためのガイド付きウィザード。