dphnAI/sonar
Large-scale LLM inference engine
解決する課題
Sonarは、本番環境においてHugging Face互換の言語およびマルチモーダルモデルをサービングするために設計された高性能推論エンジンです。大規模なモデルをデプロイする際のメモリ管理とスループット効率の課題を解決します。
仕組み
vLLMに基づき、Sonarはいくつかの高度なメモリおよび計算の最適化を実装しています。継続的バッチ処理とPaged KV-cache管理を使用して、GPUメモリの利用率を最大化します。さらに速度を向上させるため、投機的デコーディング(EAGLEやMTPなどの手法を使用)と最適化されたカーネルを使用します。Rayクラスターを必要とせずに複数ノードにわたる分散サービングをサポートし、NIXLのようなKVコネクタを介してprefill/decodeの分離を可能にします。
対象者
NVIDIA、AMD、Apple silicon、Google TPUを含む幅広いハードウェアプラットフォームをサポートし、高スループットかつ低レイテンシで本番グレードのAIモデルをデプロイする必要がある開発者やMLエンジニアを対象としています。
ハイライト
- 高スループットサービング: 継続的バッチ処理とPaged KV-cache管理を使用。
- 幅広いハードウェアサポート: NVIDIA CUDA、AMD ROCm、Apple silicon (Metal)、およびGoogle TPUと互換性があります。
- 分散サービング: 複数ノードにわたるテンソル、パイプライン、データ、およびエキスパート並列処理をサポート。
- 高度なデコーディング: 投機的デコーディングを実装し、量子化された重みとFP8 KV cacheをサポート。
- マルチモーダルサポート: 画像、音声、ビデオモデルのサービングが可能。
- API互換性: OpenAI、Anthropic、およびKobold APIを提供。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト