spark-arena/sparkrun
sparkrun - launch, manage, and stop LLM inference workloads on NVIDIA DGX Spark systems
它解決了什麼問題
sparkrun 簡化了在 NVIDIA DGX Spark 系統上部署與管理大型語言模型(LLM)推論工作負載的流程。它消除了對 Slurm 或 Kubernetes 等複雜編排工具的需求,提供一個精簡的命令列介面來啟動、管理與停止模型。
它如何運作
此工具使用引導式設定精靈來配置叢集、建立 SSH 網格,並偵測 ConnectX-7 NIC 等硬體。之後使用者可以透過 Git 版註冊表中的「配方」來啟動推論工作。工具會自動透過 SSH 在叢集節點之間分發模型與容器,並透過自動偵測 InfiniBand/RDMA 支援多節點張量平行。
目標對象
使用 NVIDIA DGX Spark 系統的開發者與研究人員,想要快速部署 LLM 推論工作負載,卻不想承擔複雜叢集管理軟體的負擔。
重點特色
- 多執行環境支援:支援 vLLM、SGLang 與 llama.cpp。
- 多節點張量平行:使用
--tp旗標即可輕鬆在多台主機上擴展。 - 最終階段 VRAM 估算:在啟動前預測模型是否能放入記憶體。
- 基於 Git 的配方註冊表:透過 Spark Arena 存取官方、社群與基準測試配方。
- 自動化設定:引導式精靈協助建立叢集、SSH 網格與硬體偵測。
- 簡化分發:自動同步模型與映像檔至叢集節點。