spark-arena/sparkrun
sparkrun - launch, manage, and stop LLM inference workloads on NVIDIA DGX Spark systems. Live support: https://discord.com/invite/GH5kRgv6ZD
何を解決するか
Sparkrunは、NVIDIA DGX Sparkシステム上でのLLM推論ワークロードのデプロイと管理を簡素化します。SlurmやKubernetesのような複雑なオーケストレーションツールの必要性を排除し、モデルの起動と管理のための合理化されたコマンドラインインターフェースを提供します。
仕組み
Sparkrunは、ガイド付きセットアップウィザードを使用して、クラスター、SSHメッシュ、およびハードウェア検出(ConnectX-7 NICなど)を構成します。SSHを介してクラスターノード間でモデルとコンテナの配布を管理し、マルチノード・テンソル並列化をサポートします。ユーザーがGitHubにホストされている公式またはコミュニティのレジストリから最適化された構成をプルできる、レシピベースのシステムを利用しています。
対象ユーザー
NVIDIA DGX Sparkハードウェアを使用しており、従来のクラスター管理ソフトウェアのオーバーヘッドなしにLLM推論エンジンを迅速にデプロイしたい開発者や研究者向けに設計されています。
ハイライト
- マルチランタイムサポート: vLLM、SGLang、およびllama.cppに標準で対応しています。
- マルチノード・テンソル並列化: InfiniBand/RDMAを自動的に検出し、複数のホストにわたってスケールさせます。
- VRAM見積もり: 起動前にモデルがメモリに収まるかどうかを予測します。
- Gitベースのレシピレジストリ: 最適化されたモデルデプロイのための、公式、コミュニティ、およびベンチマーク済みのレシピにアクセスできます。
- 自動セットアップ: クラスター作成、SSHメッシュ、およびシステム構成のためのガイド付きウィザード。
- モデル配布: モデルとイメージをクラスターノードに自動的に同期します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト