vllm-project/production-stack
vLLM’s reference system for K8S-native cluster-wide deployment with community-driven performance optimization
解决的问题
本项目提供 vLLM 在生产环境中的参考实现。解决了从单实例扩展到分布式部署时无需修改应用代码的挑战,同时提供内置监控和性能优化功能,如请求路由和 KV 缓存卸载。
工作原理
该堆栈通过 Helm 在 Kubernetes 上部署,主要由三个核心组件组成:
- 服务引擎:多个运行 LLM 的 vLLM 引擎。
- 请求路由层:根据路由键或会话 ID 将流量导向最合适的后端,以最大化 KV 缓存复用。
- 可观测性堆栈:使用 Prometheus 和 Grafana 的监控系统,用于跟踪延迟、首次令牌时间(TTFT)和 GPU KV 缓存使用率等指标。
适用人群
需要将基于 vLLM 的 LLM 服务从单节点设置迁移至跨 AWS、GCP、Azure、Lambda Labs 等多种云平台的可扩展、生产就绪的 Kubernetes 集群的开发人员和机器学习工程师。
主要亮点
- 无缝扩展:无需修改应用代码即可扩展 vLLM 实例。
- 智能路由:支持轮询和基于会话 ID 的路由,提升效率。
- OpenAI API 兼容:保持与 vLLM 相同的接口,便于集成。
- 全面监控:提供详细的 Grafana 仪表板,用于跟踪请求延迟、待处理请求和 KV 缓存命中率。
- KV 缓存卸载:与 LMCache 集成以优化性能。
相关
- 项目
- 项目
- 项目
- 项目
- 项目