dphnAI/sonar

Large-scale LLM inference engine

解決する課題

Sonarは、本番環境においてHugging Face互換の言語およびマルチモーダルモデルをサービングするために設計された高性能推論エンジンです。大規模なモデルをデプロイする際のメモリ管理とスループット効率の課題を解決します。

仕組み

vLLMに基づき、Sonarはいくつかの高度なメモリおよび計算の最適化を実装しています。継続的バッチ処理とPaged KV-cache管理を使用して、GPUメモリの利用率を最大化します。さらに速度を向上させるため、投機的デコーディング(EAGLEやMTPなどの手法を使用)と最適化されたカーネルを使用します。Rayクラスターを必要とせずに複数ノードにわたる分散サービングをサポートし、NIXLのようなKVコネクタを介してprefill/decodeの分離を可能にします。

対象者

NVIDIA、AMD、Apple silicon、Google TPUを含む幅広いハードウェアプラットフォームをサポートし、高スループットかつ低レイテンシで本番グレードのAIモデルをデプロイする必要がある開発者やMLエンジニアを対象としています。

ハイライト

  • 高スループットサービング: 継続的バッチ処理とPaged KV-cache管理を使用。
  • 幅広いハードウェアサポート: NVIDIA CUDA、AMD ROCm、Apple silicon (Metal)、およびGoogle TPUと互換性があります。
  • 分散サービング: 複数ノードにわたるテンソル、パイプライン、データ、およびエキスパート並列処理をサポート。
  • 高度なデコーディング: 投機的デコーディングを実装し、量子化された重みとFP8 KV cacheをサポート。
  • マルチモーダルサポート: 画像、音声、ビデオモデルのサービングが可能。
  • API互換性: OpenAI、Anthropic、およびKobold APIを提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト