gpustack/gpustack

A GPU cluster manager for high-performance AI model serving (vLLM, SGLang) and on-demand SSH-accessible GPU instances.

解決する課題

GPUStackは、AIモデルのサービングとインスタンスプロビジョニングのためのGPUクラスター管理を簡素化します。異なる環境(オンプレミス、Kubernetes、クラウド)にわたる推論エンジンの手動設定やハードウェア管理の複雑さを排除し、チームがAIモデルをサービスとしてデプロイおよびスケールできるようにします。

仕組み

GPUStackは、複数のGPUクラスターを管理するオーケストレーションレイヤーとして機能します。vLLM、SGLang、TensorRT-LLMなどの高性能な推論エンジンを自動的に選択・設定するか、カスタムエンジンを使用することも可能です。システムには、リソース利用率を最大化するためにGPUを割り当てるスケジューラが含まれており、デプロイされたモデルにアクセスするためのOpenAI互換APIを提供します。

対象ユーザー

多様なハードウェアアクセラレータ(NVIDIA、AMD、Ascendなど)にわたって、大規模にModel-as-a-Serviceを提供する必要がある開発チーム、IT組織、およびサービスプロバイダー向けに設計されています。

ハイライト

  • マルチクラスター管理: オンプレミス、Kubernetes、およびクラウド環境をサポート。
  • プラグイン式エンジン: vLLM、SGLang、TensorRT-LLMの自動設定に加え、カスタムエンジンもサポート。
  • パフォーマンスの最適化: Speculative decoding(EAGLE3、MTP、N-grams)および拡張KVキャッシュシステム(LMCache、HiCache)を内蔵。
  • オンデマンドインスタンス: 開発やファインチューニング用に、SSHアクセス可能なGPUインスタンスを起動。
  • 幅広いハードウェアサポート: NVIDIA、AMD、Ascend NPUなど、幅広いアクセラレータに対応。
  • エンタープライズ運用: 自動障害復旧、ロードバランシング、モニタリング(Grafana/Prometheus)、およびアクセス制御を含む。