vllm-project/production-stack

vLLM’s reference system for K8S-native cluster-wide deployment with community-driven performance optimization

解决的问题

本项目提供 vLLM 在生产环境中的参考实现。解决了从单实例扩展到分布式部署时无需修改应用代码的挑战,同时提供内置监控和性能优化功能,如请求路由和 KV 缓存卸载。

工作原理

该堆栈通过 Helm 在 Kubernetes 上部署,主要由三个核心组件组成:

  • 服务引擎:多个运行 LLM 的 vLLM 引擎。
  • 请求路由层:根据路由键或会话 ID 将流量导向最合适的后端,以最大化 KV 缓存复用。
  • 可观测性堆栈:使用 Prometheus 和 Grafana 的监控系统,用于跟踪延迟、首次令牌时间(TTFT)和 GPU KV 缓存使用率等指标。

适用人群

需要将基于 vLLM 的 LLM 服务从单节点设置迁移至跨 AWS、GCP、Azure、Lambda Labs 等多种云平台的可扩展、生产就绪的 Kubernetes 集群的开发人员和机器学习工程师。

主要亮点

  • 无缝扩展:无需修改应用代码即可扩展 vLLM 实例。
  • 智能路由:支持轮询和基于会话 ID 的路由,提升效率。
  • OpenAI API 兼容:保持与 vLLM 相同的接口,便于集成。
  • 全面监控:提供详细的 Grafana 仪表板,用于跟踪请求延迟、待处理请求和 KV 缓存命中率。
  • KV 缓存卸载:与 LMCache 集成以优化性能。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目