gpustack/gpustack

A GPU cluster manager for high-performance AI model serving (vLLM, SGLang) and on-demand SSH-accessible GPU instances.

解決的問題

GPUStack 簡化了用於 AI 模型服務與實例配置的 GPU 集群管理。它消除了在不同環境(本地、Kubernetes 與雲端)中手動配置推理引擎與管理硬體的複雜性,讓團隊能夠像提供服務一樣部署並擴展 AI 模型。

工作原理

GPUStack 作為一個編排層來管理多個 GPU 集群。它可以自動選擇並配置高性能推理引擎(如 vLLM、SGLang 與 TensorRT-LLM),或者允許使用自定義引擎。該系統包含一個調度器,用於分配 GPU 以實現資源利用率最大化,並提供用於存取已部署模型的 OpenAI 相容 API。

適用對象

專為需要在各種硬體加速器(NVIDIA、AMD、Ascend 等)上大規模提供模型即服務 (Model-as-a-Service) 的開發團隊、IT 組織與服務提供商而設計。

亮點

  • 多集群管理:支援本地、Kubernetes 與雲端環境。
  • 可插拔引擎:支援 vLLM、SGLang 與 TensorRT-LLM 的自動化配置,並支援自定義引擎。
  • 效能優化:內建對投機解碼 (EAGLE3, MTP, N-grams) 與擴展 KV 快取系統 (LMCache, HiCache) 的支援。
  • 按需實例:啟動可進行 SSH 存取的 GPU 實例,用於開發與微調。
  • 廣泛的硬體支援:相容於包括 NVIDIA、AMD、Ascend NPU 在內的各種加速器。
  • 企業級營運:包括自動故障復原、負載平衡、監控 (Grafana/Prometheus) 與存取控制。