llm-d/llm-d-router
llm-d Router: The intelligent entry point for inference requests
何を解決するか
大規模言語モデル(LLM)の推論トラフィックを効率的にルーティングする課題に対処し、リアルタイムの信号(負荷、優先度、KVキャッシュの局所性など)に基づいてリクエストの配置を最適化することで、遅延を低減しリソース利用効率を向上させます。
動作方法
システムは、Envoyのようなプロキシとエンドポイントピッカー(EPP)を統合した知能的なエントリポイントである llm-d Router で構成されています。EPPは「脳」として機能し、インフェレンスプールの状態を基に着信リクエストのルーティング判断を行います。ext-proc プロトコルを介してプロキシと連携します。スタンドアロンモード(EnvoyとEPPを1つのポッドに配置)またはゲートウェイモード(Kubernetes Gateway APIと統合して大規模なトラフィック管理に対応)の両方でデプロイ可能です。
対象ユーザー
LLM推論インフラを管理するエンジニアやオペレーター向けです。高度なロードバランシング、リクエストの優先順位付け、および複雑な推論ライフサイクル(例:Prefill/Decodeの分離)のサポートが必要な方々に最適です。
特徴
- KVキャッシュに配慮したルーティング:キャッシュの局所性に基づいてリクエストの配置を最適化します。
- 柔軟なデプロイメント:シンプルなスタンドアロン設定から、本番環境向けのKubernetes Gateway API統合まで対応可能です。
- リクエスト管理:スケジューリング目標(InferenceObjective)の設定や、A/Bテスト用のモデル名リライト(InferenceModelRewrite)を実行するためのAPIを提供します。
- 分離対応:Encode/Prefill/Decodeの複数段階推論ライフサイクルを調整するサイドカーコンポーネントを備えています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト