llm-d/llm-d
Achieve state of the art inference performance with modern accelerators on Kubernetes
解决的问题
llm-d 旨在消除大规模生产环境中微调和部署大语言模型 (LLM) 的复杂性。它通过提供一个编排和优化层,在各种硬件加速器上最大化吞吐量并降低延迟,从而解决标准模型服务器的性能瓶颈。
工作原理
llm-d 与 vLLM 和 Kubernetes 等行业标准技术集成,提供分布式推理服务栈。它采用多种先进技术来优化性能:
- 智能路由: 使用 prefix-cache 和负载感知平衡,以及预测延迟调度来降低延迟并提高吞吐量。
- KV-Cache 管理: 实现向 CPU 或磁盘的分层卸载和全局索引,以增加多轮对话请求的有效工作集大小。
- 大模型服务: 利用 prefill/decode disaggregation 以及通过快速互连的宽专家并行 (wide expert-parallelism) 来优化大规模模型。
- 卓越运营: 为多租户服务提供智能流控制,并基于实时信号进行 SLO 感知的自动扩缩容。
- 批处理: 通过兼容 OpenAI 的 Batch API 和异步处理来管理大规模离线推理。
适用对象
本项目面向在 Kubernetes 生产环境中部署 LLM 的工程师和组织,旨在各种硬件加速器(如 NVIDIA、AMD、Intel 和 Google TPU)上实现最先进 (SOTA) 的推理性能。
亮点
- CNCF Sandbox 项目: 由包括 Red Hat、Google Cloud、IBM Research、CoreWeave 和 NVIDIA 在内的行业领导者发起。
- 显著的性能提升: 经过验证,通过 prefix-cache 感知路由,输出吞吐量可提高 3 倍,TTFT 可加快 2 倍。
- 广泛的硬件支持: 针对各种加速器和基础设施提供商进行了优化。
- 生产就绪方案: 提供基准测试指南和 Helm charts,以简化部署和最佳实践。