spark-arena/sparkrun
sparkrun - launch, manage, and stop LLM inference workloads on NVIDIA DGX Spark systems. Live support: https://discord.com/invite/GH5kRgv6ZD
它解決的問題
Sparkrun 簡化了在 NVIDIA DGX Spark 系統上部署和管理 LLM 推論工作負載的流程。它消除了對複雜編排工具(如 Slurm 或 Kubernetes)的需求,提供了一個簡潔的命令列介面來啟動和管理模型。
如何運作
Sparkrun 使用導向式設定精靈來配置叢集、SSH 網狀結構以及硬體檢測(例如 ConnectX-7 網卡)。它透過 SSH 管理模型和容器在叢集節點之間的分發,並支援多節點張量平行處理。它採用食譜系統,使用者可從 GitHub 上主機的官方或社群註冊表中拉取優化過的設定。
適用對象
此工具專為使用 NVIDIA DGX Spark 硬體的開發人員和研究人員設計,希望快速部署 LLM 推論引擎,而不必承擔傳統叢集管理軟體的額外負擔。
主要特色
- 多執行時支援:原生支援 vLLM、SGLang 和 llama.cpp。
- 多節點張量平行處理:自動偵測 InfiniBand/RDMA,以跨多個主機擴展。
- VRAM 評估:在啟動前預測模型是否能適應記憶體。
- 基於 Git 的食譜註冊表:可存取官方、社群及經過基準測試的食譜,以實現最佳化的模型部署。
- 自動化設定:導向式精靈協助建立叢集、SSH 網狀結構和系統設定。
- 模型分發:自動將模型和映像檔同步至叢集節點。
"Sparkrun 讓我們能夠快速部署和管理大型語言模型,而無需複雜的基礎設施配置。" — @handle
相關
- 專案
- 專案
- 專案
- 專案
- 專案