gpustack/gpustack

A GPU cluster manager for high-performance AI model serving (vLLM, SGLang) and on-demand SSH-accessible GPU instances.

해결하는 문제

GPUStack은 AI 모델 서비스 및 인스턴스 프로비저닝을 위한 GPU 클러스터 관리를 간소화합니다. 고성능 추론 엔진을 수동으로 구성하거나, 온프레미스 서버, Kubernetes, 클라우드 공급자 등 다양한 환경 간에 리소스를 오케스트레이션하는 복잡성을 제거합니다.

작동 방식

GPUStack은 여러 GPU 클러스터를 관리하는 오케스트레이션 계층으로 작동합니다. vLLM, SGLang, TensorRT-LLM 등의 플러그인형 추론 엔진을 자동으로 구성하고 배포하며, 낮은 지연 시간 또는 높은 처리량을 위해 최적화합니다. 시스템은 GPU 할당을 최적화하여 자원 활용률을 극대화하는 스케줄러를 포함하며, 배포된 모델에 접근할 수 있는 OpenAI 호환 API를 제공합니다.

대상 사용자

대규모 Model-as-a-Service (MaaS)를 제공해야 하는 개발 팀, IT 조직, 서비스 제공업체, 그리고 파인튜닝 및 인터랙티브 워크로드용 온디맨드 SSH 접근 가능한 GPU 인스턴스가 필요한 개발자에게 적합합니다.

주요 특징

  • 다중 클러스터 관리: 온프레미스, Kubernetes, 클라우드 환경을 하나의 뷰에서 지원합니다.
  • 플러그인 엔진: vLLM, SGLang, TensorRT-LLM 또는 사용자 정의 엔진을 사용해 새로운 모델을 빠르게 배포할 수 있습니다.
  • 성능 최적화: 사전 최적화된 모드와 함께 추측 디코딩(EAGLE3, MTP, N-grams) 및 확장된 KV 캐시 시스템(LMCache, HiCache)을 지원합니다.
  • 광범위한 하드웨어 호환성: NVIDIA, AMD, Ascend, Hygon, MetaX 및 기타 가속기와 호환됩니다.
  • 엔터프라이즈 운영: 내장된 인증, 접근 제어, Grafana/Prometheus를 통한 실시간 모니터링, 자동 장애 복구 기능을 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트