gpustack/gpustack
A GPU cluster manager for high-performance AI model serving (vLLM, SGLang) and on-demand SSH-accessible GPU instances.
解決的問題
GPUStack 簡化了 AI 模型服務與實例供應的 GPU 集群管理。它消除了手動設定高效率推論引擎,以及在不同環境(如本地伺服器、Kubernetes 和雲端供應商)之間協調資源的複雜性。
工作原理
GPUStack 作為一個編排層,管理多個 GPU 集群。它會自動配置並部署可插入的推論引擎(如 vLLM、SGLang 和 TensorRT-LLM),並針對低延遲或高吞吐量進行優化。系統包含一個排程器,用於分配 GPU 以最大化資源利用率,並提供與 OpenAI 相容的 API 以存取已部署的模型。
適用對象
專為需要大規模交付 Model-as-a-Service (MaaS) 的開發團隊、IT 組織與服務提供者設計,也適用於需要按需 SSH 可存取 GPU 實例進行微調與互動式工作負載的開發者。
主要亮點
- 多集群管理:在單一視圖中支援本地、Kubernetes 和雲端環境。
- 可插入引擎:使用 vLLM、SGLang、TensorRT-LLM 或自訂引擎快速部署新模型。
- 效能優化:包含預先調校模式,支援推測解碼(EAGLE3、MTP、N-grams)與擴展 KV 快取系統(LMCache、HiCache)。
- 廣泛的硬體支援:相容 NVIDIA、AMD、Ascend、Hygon、MetaX 及其他加速器。
- 企業級運維:內建認證、存取控制、透過 Grafana/Prometheus 實現即時監控,以及自動故障復原功能。
相關
- 專案
- 專案
- 專案
- 專案
- 專案