llm-d/llm-d-router

llm-d Router: The intelligent entry point for inference requests

何を解決するか

大規模言語モデル(LLM)の推論トラフィックを効率的にルーティングする課題に対処し、リアルタイムの信号(負荷、優先度、KVキャッシュの局所性など)に基づいてリクエストの配置を最適化することで、遅延を低減しリソース利用効率を向上させます。

動作方法

システムは、Envoyのようなプロキシとエンドポイントピッカー(EPP)を統合した知能的なエントリポイントである llm-d Router で構成されています。EPPは「脳」として機能し、インフェレンスプールの状態を基に着信リクエストのルーティング判断を行います。ext-proc プロトコルを介してプロキシと連携します。スタンドアロンモード(EnvoyとEPPを1つのポッドに配置)またはゲートウェイモード(Kubernetes Gateway APIと統合して大規模なトラフィック管理に対応)の両方でデプロイ可能です。

対象ユーザー

LLM推論インフラを管理するエンジニアやオペレーター向けです。高度なロードバランシング、リクエストの優先順位付け、および複雑な推論ライフサイクル(例:Prefill/Decodeの分離)のサポートが必要な方々に最適です。

特徴

  • KVキャッシュに配慮したルーティング:キャッシュの局所性に基づいてリクエストの配置を最適化します。
  • 柔軟なデプロイメント:シンプルなスタンドアロン設定から、本番環境向けのKubernetes Gateway API統合まで対応可能です。
  • リクエスト管理:スケジューリング目標(InferenceObjective)の設定や、A/Bテスト用のモデル名リライト(InferenceModelRewrite)を実行するためのAPIを提供します。
  • 分離対応:Encode/Prefill/Decodeの複数段階推論ライフサイクルを調整するサイドカーコンポーネントを備えています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト