gpustack/gpustack

A GPU cluster manager for high-performance AI model serving (vLLM, SGLang) and on-demand SSH-accessible GPU instances.

何を解決するか

GPUStackは、AIモデルのサービングおよびインスタンスプロビジョニングのためのGPUクラスタ管理を簡素化します。高パフォーマンスな推論エンジンの手動設定や、オンプレミスサーバー、Kubernetes、クラウドプロバイダーなど多様な環境間でのリソースのオーケストレーションの複雑さを解消します。

動作方法

GPUStackは複数のGPUクラスタを管理するオーケストレーションレイヤーとして機能します。vLLM、SGLang、TensorRT-LLMなどのプラグイン型推論エンジンを自動的に構成・デプロイし、低遅延または高スループットの最適化を実現します。スケジューラによりGPUを割り当ててリソース利用効率を最大化し、OpenAI互換APIを通じてデプロイされたモデルにアクセスできます。

対象ユーザー

スケーラブルなModel-as-a-Service(MaaS)を提供する開発チーム、IT組織、サービスプロバイダー、およびファインチューニングやインタラクティブワークロード用にオンデマンドでSSHアクセス可能なGPUインスタンスが必要な開発者に最適です。

主な特徴

  • マルチクラスタ管理: オンプレミス、Kubernetes、クラウド環境を1つのビューで統合管理。
  • プラグイン型エンジン: vLLM、SGLang、TensorRT-LLM、またはカスタムエンジンを使って新規モデルを迅速にデプロイ可能。
  • パフォーマンス最適化: 事前に最適化されたモードと、推測デコード(EAGLE3、MTP、N-grams)および拡張KVキャッシュシステム(LMCache、HiCache)をサポート。
  • 広範なハードウェア対応: NVIDIA、AMD、Ascend、Hygon、MetaX、およびその他のアクセラレータと互換性あり。
  • エンタープライズ運用: ログイン認証、アクセス制御、Grafana/Prometheusによるリアルタイムモニタリング、自動障害回復機能を内蔵。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト