spark-arena/sparkrun

sparkrun - launch, manage, and stop LLM inference workloads on NVIDIA DGX Spark systems. Live support: https://discord.com/invite/GH5kRgv6ZD

它解决了什么问题

Sparkrun 简化了在 NVIDIA DGX Spark 系统上部署和管理大语言模型(LLM)推理工作负载的过程。它消除了对复杂编排工具(如 Slurm 或 Kubernetes)的需求,提供了一个简化的命令行界面,用于启动和管理模型。

它如何工作

Sparkrun 使用引导式设置向导来配置集群、SSH 网络和硬件检测(例如 ConnectX-7 网卡)。它通过 SSH 管理模型和容器在集群节点间的分发,并支持多节点张量并行。它采用基于配方的系统,用户可以从 GitHub 上托管的官方或社区注册表中拉取优化的配置。

适用人群

专为使用 NVIDIA DGX Spark 硬件的开发者和研究人员设计,他们希望快速部署 LLM 推理引擎,而无需承担传统集群管理软件的开销。

主要特性

  • 多运行时支持:开箱即用支持 vLLM、SGLang 和 llama.cpp。
  • 多节点张量并行:自动检测 InfiniBand/RDMA,实现跨多个主机的扩展。
  • VRAM 估算:在启动前预测模型是否能适配内存。
  • 基于 Git 的配方注册表:可访问官方、社区及经过基准测试的配方,用于优化模型部署。
  • 自动化设置:通过引导式向导完成集群创建、SSH 网络和系统配置。
  • 模型分发:自动将模型和镜像同步到集群节点。

"Sparkrun 让在 DGX Spark 上运行 LLM 推理变得像运行一个命令一样简单。" — @sparkrun

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目