vllm-project/production-stack

vLLM’s reference system for K8S-native cluster-wide deployment with community-driven performance optimization

解決的問題

本專案提供 vLLM 在生產環境中的參考實作。解決從單一實例擴展至分散式部署時無需修改應用程式程式碼的挑戰,同時提供內建監控與效能最佳化功能,如請求路由與 KV 快取卸載。

工作原理

此堆疊透過 Helm 在 Kubernetes 上部署,主要由三個核心元件組成:

  • 服務引擎:多個執行 LLM 的 vLLM 引擎。
  • 請求路由層:根據路由鍵或會話 ID 將流量導向最合適的後端,以最大化 KV 快取重用。
  • 可觀測性堆疊:使用 Prometheus 與 Grafana 的監控系統,用於追蹤延遲、首次令牌時間(TTFT)與 GPU KV 快取使用率等指標。

適用對象

需要將基於 vLLM 的 LLM 服務從單節點設定遷移至跨 AWS、GCP、Azure、Lambda Labs 等多種雲端平台的可擴展、生產就緒 Kubernetes 集群的開發人員與機器學習工程師。

主要亮點

  • 無縫擴展:無需修改應用程式程式碼即可擴展 vLLM 實例。
  • 智慧路由:支援輪詢與基於會話 ID 的路由,提升效率。
  • OpenAI API 相容:維持與 vLLM 相同的介面,便於整合。
  • 全面監控:提供詳細的 Grafana 儀表板,用於追蹤請求延遲、待處理請求與 KV 快取命中率。
  • KV 快取卸載:與 LMCache 集成以優化效能。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案