llm-d/llm-d-router

llm-d Router: The intelligent entry point for inference requests

解決的問題

解決大型語言模型(LLMs)推理流量高效路由的挑戰,透過基於即時訊號(如負載、優先權與 KV 快取區域性)優化請求放置,以降低延遲並提升資源利用率。

工作原理

系統由一個稱為 llm-d Router 的智慧入口組成,結合代理(如 Envoy)與端點選擇器(EPP)。EPP 作為「大腦」,根據推理池的狀態評估進來的請求以做出路由決策。它透過 ext-proc 協定與代理整合。支援兩種部署模式:獨立模式(Envoy 與 EPP 部署在同一個 Pod 中)或網關模式(與 Kubernetes Gateway API 整合,用於生產級流量管理)。

適用對象

專為管理 LLM 推理基礎設施的工程師與運維人員設計,適用於需要高階負載平衡、請求優先權處理以及支援複雜推理生命週期(如 Prefill/Decode 分離)的場景。

核心亮點

  • KV 快取感知路由:基於快取區域性優化請求放置。
  • 彈性部署:支援簡單的獨立部署,也支援生產級 Kubernetes Gateway API 整合。
  • 請求管理:提供 API 用於設定排程目標(InferenceObjective)與執行模型名稱重寫(InferenceModelRewrite),支援 A/B 測試。
  • 支援分離架構:提供側車元件,用於協調多階段推理生命週期(Encode/Prefill/Decode)。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案