llm-d/llm-d
Achieve state of the art inference performance with modern accelerators on Kubernetes
解決的問題
llm-d 旨在消除大規模生產環境中微調和部署大語言模型 (LLM) 的複雜性。它透過提供一個編排與優化層,在各種硬體加速器上最大化吞吐量並降低延遲,從而解決標準模型伺服器的效能瓶頸。
工作原理
llm-d 與 vLLM 和 Kubernetes 等業界標準技術整合,提供分散式推理服務棧。它採用多種先進技術來優化效能:
- 智慧路由: 使用 prefix-cache 與負載感知平衡,以及預測延遲排程來降低延遲並提高吞吐量。
- KV-Cache 管理: 實作向 CPU 或磁碟的分層卸載與全域索引,以增加多輪對話請求的有效工作集大小。
- 大模型服務: 利用 prefill/decode disaggregation 以及透過快速互連的寬專家並行 (wide expert-parallelism) 來優化大規模模型。
- 卓越營運: 為多租戶服務提供智慧流控制,並基於即時訊號進行 SLO 感知的自動擴縮容。
- 批處理: 透過相容 OpenAI 的 Batch API 與非同步處理來管理大規模離線推理。
適用對象
本專案面向在 Kubernetes 生產環境中部署 LLM 的工程師與組織,旨在各種硬體加速器(如 NVIDIA、AMD、Intel 和 Google TPU)上實現最先進 (SOTA) 的推理效能。
亮點
- CNCF Sandbox 專案: 由包括 Red Hat、Google Cloud、IBM Research、CoreWeave 和 NVIDIA 在內的業界領導者發起。
- 顯著的效能提升: 經過驗證,透過 prefix-cache 感知路由,輸出吞吐量可提高 3 倍,TTFT 可加快 2 倍。
- 廣泛的硬體支援: 針對各種加速器與基礎設施提供商進行了優化。
- 生產就緒方案: 提供基準測試指南與 Helm charts,以簡化部署與最佳實踐。