spark-arena/sparkrun

sparkrun - launch, manage, and stop LLM inference workloads on NVIDIA DGX Spark systems

它解決了什麼問題

sparkrun 簡化了在 NVIDIA DGX Spark 系統上部署與管理大型語言模型(LLM)推論工作負載的流程。它消除了對 Slurm 或 Kubernetes 等複雜編排工具的需求,提供一個精簡的命令列介面來啟動、管理與停止模型。

它如何運作

此工具使用引導式設定精靈來配置叢集、建立 SSH 網格,並偵測 ConnectX-7 NIC 等硬體。之後使用者可以透過 Git 版註冊表中的「配方」來啟動推論工作。工具會自動透過 SSH 在叢集節點之間分發模型與容器,並透過自動偵測 InfiniBand/RDMA 支援多節點張量平行。

目標對象

使用 NVIDIA DGX Spark 系統的開發者與研究人員,想要快速部署 LLM 推論工作負載,卻不想承擔複雜叢集管理軟體的負擔。

重點特色

  • 多執行環境支援:支援 vLLM、SGLang 與 llama.cpp。
  • 多節點張量平行:使用 --tp 旗標即可輕鬆在多台主機上擴展。
  • 最終階段 VRAM 估算:在啟動前預測模型是否能放入記憶體。
  • 基於 Git 的配方註冊表:透過 Spark Arena 存取官方、社群與基準測試配方。
  • 自動化設定:引導式精靈協助建立叢集、SSH 網格與硬體偵測。
  • 簡化分發:自動同步模型與映像檔至叢集節點。