kserve/kserve

Standardized Distributed Generative and Predictive AI Inference Platform for Scalable, Multi-Framework Deployment on Kubernetes

解決する課題

KServeは、Kubernetes上で生成AIと予測AIの両方のモデルをデプロイおよびスケールさせるための標準化された方法を提供します。マルチフレームワークのデプロイ管理の複雑さを排除し、オートスケーリングやリソースの最適化など、エンタープライズ規模のAIワークロードのインフラストラクチャのニーズに対応します。

仕組み

KServeは、異なるAIワークロードを統合する推論プラットフォームとして機能します。生成AIに対しては、vLLMやllm-dのような最適化されたバックエンドを使用し、OpenAI互換プロトコルをサポートします。予測AIに対しては、複数のフレームワーク(TensorFlow、PyTorch、scikit-learnなど)をサポートし、InferenceGraphを使用して予測器(predictor)、変換器(transformer)、説明器(explainer)間のリクエストルーティングを管理します。軽量なスタンドアロンサービス、Knativeを介したサーバーレスデプロイ、またはModelMeshを介した高密度デプロイとしてインストール可能です。

対象ユーザー

Kubernetes上でAIモデルを大規模にデプロイする必要がある組織や開発者向けに設計されており、迅速なデプロイを必要とする層から、高度なトラフィック管理とコスト効率の高いリソーススケーリングを必要とするエンタープライズまで幅広く対応します。

ハイライト

  • 統合された推論: 単一のプラットフォーム上で生成AI (LLM) と予測AI (従来のML) の両方をサポート。
  • 生成AIの最適化: GPUアクセラレーション、CPU/ディスクへのKVキャッシュオフロード、およびインテリジェントなモデルキャッシュを含む。
  • 予測AIのツール群: 組み込みのモデル説明可能性、カナリアリリース、およびドリフトや外れ値検出のための高度なモニタリングを提供。
  • 効率的なスケーリング: リクエストベースのオートスケーリングと、モデルが使用されていないときにインフラコストを削減する「scale-to-zero」をサポート。
  • 幅広い互換性: Hugging Faceモデルや、PyTorch、TensorFlow、ONNXなどの様々なMLフレームワークをネイティブにサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト