ServerlessLLM/ServerlessLLM
Serverless LLM Serving for Everyone.
何を解決するか
ServerlessLLMは、共有GPUリソース上で複数の大規模言語モデル(LLM)をデプロイする際の高コストと高レイテンシを解決します。通常の「サーバーレス」AIデプロイを妨げる遅いモデル読み込み時間を排除し、複数のモデルをGPUメモリ間で迅速に切り替えることが可能になります。
動作方法
このシステムは3つの主要な技術的革新を採用しています:
- 高速チェックポイント読み込み:カスタムバイナリストレージフォーマットと
O_DIRECTI/O を使用してOSのページキャッシュをバイパスし、ピン止めメモリプールを活用してDMA加速転送をGPUに実行します。これにより、標準の SafeTensors より6〜10倍高速にモデルを読み込むことができます。 - GPUマルチプレクシング:ストレージを意識したスケジューリングと高速切り替えを実装し、1つのGPUで多数の異なるモデルを提供可能にします。アイドル時はインスタンスをゼロにスケーリングすることも可能です。
- 統合パイプライン:推論とLoRAファインチューニングを統合し、1つのベースモデルと数百の専用LoRAアダプタを効率的に提供できます。
対象ユーザー
限られたGPUハードウェア上で複数のAIモデルをホストする必要がある開発者やインフラエンジニア、サーバーレスAIプラットフォームの構築者、多数のユーザー/タスクに対してオンデマンドでのファインチューニングと推論を必要とするチームに最適です。
主な特徴
- 極めて高速な読み込み:SafeTensorsより6〜10倍高速にモデルを読み込みます。
- 高密度:1つのGPUで10個以上のモデルを提供可能です。
- 広範な互換性:vLLM、Transformersに対応し、NVIDIAおよびAMD GPUの両方をサポートします。
- プロダクション対応:OpenAI互換APIを提供し、Docker、Kubernetes、マルチノードクラスタをサポートします。
- RAG対応:専用の埋め込みエンドポイントを介して、LLMと共に埋め込みモデルをデプロイできます。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト