ServerlessLLM/ServerlessLLM

Serverless LLM Serving for Everyone.

何を解決するか

ServerlessLLMは、共有GPUリソース上で複数の大規模言語モデル(LLM)をデプロイする際の高コストと高レイテンシを解決します。通常の「サーバーレス」AIデプロイを妨げる遅いモデル読み込み時間を排除し、複数のモデルをGPUメモリ間で迅速に切り替えることが可能になります。

動作方法

このシステムは3つの主要な技術的革新を採用しています:

  1. 高速チェックポイント読み込み:カスタムバイナリストレージフォーマットと O_DIRECT I/O を使用してOSのページキャッシュをバイパスし、ピン止めメモリプールを活用してDMA加速転送をGPUに実行します。これにより、標準の SafeTensors より6〜10倍高速にモデルを読み込むことができます。
  2. GPUマルチプレクシング:ストレージを意識したスケジューリングと高速切り替えを実装し、1つのGPUで多数の異なるモデルを提供可能にします。アイドル時はインスタンスをゼロにスケーリングすることも可能です。
  3. 統合パイプライン:推論とLoRAファインチューニングを統合し、1つのベースモデルと数百の専用LoRAアダプタを効率的に提供できます。

対象ユーザー

限られたGPUハードウェア上で複数のAIモデルをホストする必要がある開発者やインフラエンジニア、サーバーレスAIプラットフォームの構築者、多数のユーザー/タスクに対してオンデマンドでのファインチューニングと推論を必要とするチームに最適です。

主な特徴

  • 極めて高速な読み込み:SafeTensorsより6〜10倍高速にモデルを読み込みます。
  • 高密度:1つのGPUで10個以上のモデルを提供可能です。
  • 広範な互換性:vLLM、Transformersに対応し、NVIDIAおよびAMD GPUの両方をサポートします。
  • プロダクション対応:OpenAI互換APIを提供し、Docker、Kubernetes、マルチノードクラスタをサポートします。
  • RAG対応:専用の埋め込みエンドポイントを介して、LLMと共に埋め込みモデルをデプロイできます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト