snowflakedb/ArcticInference

ArcticInference: vLLM plugin for high-throughput, low-latency inference

何を解決するか

Arctic Inference は、大規模言語モデル(LLM)および埋め込み推論におけるパフォーマンスのボトルネックに対処し、特に遅延の低減とスループットの向上に焦点を当てています。リクエストの処理とトークン生成の最適化を通じて、これらのモデルをよりコスト効率よくデプロイできるようにすることを目指しています。

動作方法

vLLM のプラグインとして動作し、エンジンを自動的にパッチして、いくつかの高性能最適化を実装します:

  • 高度な並列処理: Shift Parallelism と Arctic Ulysses(シーケンス並列処理)を実装し、長文コンテキストの処理を可能にし、効率性を向上させます。
  • 予測的デコード: Arctic Speculator と Suffix Decoding を使用して、トークン生成を高速化します。
  • モデル最適化: SwiftKV を統合して、推論コストを削減します。
  • 専用最適化: 埋め込みモデルや推論タスク向けの特定のパフォーマンス向上を含みます。

対象ユーザー

このプロジェクトは、既に vLLM を使用している開発者や企業AIチームを対象としており、既存のAPIやCLIワークフローを変更せずに、LLMおよび埋め込みのデプロイにおいてより高いスループットと低い遅延を実現したい人向けです。

主な特徴

  • vLLM との統合: vLLM API と互換性を保ちつつ、シームレスに動作するプラグインです。
  • 顕著な高速化: LLM ではリクエスト完了が最大3.4倍速くなり、埋め込みでは最大16倍のスループット向上を実現すると主張しています。
  • 「トリフェクタ」: 応答時間(プレフィル)、1リクエストあたりの生成速度、全体の統合スループットの3つを同時に改善します。
  • 包括的な最適化パッケージ: 並列処理、予測的デコード、KVキャッシュ最適化を1つのパッケージに統合しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト