llm-d/llm-d
Achieve state of the art inference performance with modern accelerators on Kubernetes
llm‑d – 在 Kubernetes 上實現高效率分散式 LLM 推論
是什麼
- 一個開源堆疊,位於 vLLM 和 SGLang 等模型伺服器之上,為大語言模型(LLM)推論添加生產級的編排、路由與快取管理功能。
- 專為雲原生環境(Kubernetes、Helm)設計,由 Red Hat、Google Cloud、IBM Research、CoreWeave 與 NVIDIA 共同創立的 CNCF Sandbox 專案支援。
核心功能
| 領域 | llm‑d 增強的功能 |
|---|---|
| 智慧路由 | 支援前綴快取感知與負載感知的負載平衡;實驗性延遲預測排程器可降低延遲並提升吞吐量。 |
| KV 快取管理 | 將注意力 KV 快取分層卸載至 CPU 或磁碟,透過全域索引支援多輪請求保持更大的工作集。 |
| 大模型服務 | 支援預填入/解碼解耦與 廣域專家平行,可將超大型模型(如 DeepSeek‑R1、GPT‑OSS‑120B)分佈於高速互連上。 |
| 運維卓越 | 支援多租戶流量的流量控制、SLO 感知自動伸縮,以及主動-主動高可用,確保大規模服務穩定。 |
| 批次處理 | 提供 OpenAI 相容的批次 API 與非同步流水線,適用於離線工作負載,最大化硬體利用率。 |
效能亮點(來自 README 報告)
- 使用前綴快取路由的 Llama 3.1 70B 上,輸出吞吐量提升 3 倍,首次輸出時間(TTFT)縮短 2 倍(4× AMD MI300X)。
- 在 NVIDIA GPU 上使用預測延遲排程,TTFT/ITL 降低 40%。
- 透過預填入/解碼解耦,GPT‑OSS 在 AWS B200 上實現每秒最多多出 70% 的 token。
- 在 16×16 NVIDIA B200 網格上使用廣域專家平行,叢集吞吐量達 50k token/秒。
如何使用
- 部署 – 按照快速入門指南,在 Kubernetes 集群(任意雲或本地)上安裝 Helm Chart。該堆疊會自動部署路由器、快取管理器與模型伺服器 Pod。
- 設定 – 根據模型大小與硬體加速器(NVIDIA、AMD、Intel、Google TPU 等)選擇一條「明亮路徑」(如 Optimized Baseline、Tiered Prefix Cache、Wide Expert-Parallelism)。
- 執行 – 透過提供的 OpenAI 相容 REST 端點或批次 API 發送推論請求。llm‑d 將自動路由流量、管理 KV 快取層級,並根據即時延遲信號動態伸縮 Pod。
- 監控 – 內建 Prometheus 指標與 SLO 感知自動伸縮功能,可即時監控吞吐量、延遲與資源使用率。
誰會受益
- 需要以低延遲與可預測成本服務大量並發 LLM 使用者的企業。
- 希望在異構加速器上以可重現、雲原生方式執行最進階模型的 ML-ops 團隊。
- 希望無需手動調校 Kubernetes 部署即可基準測試新模型或推論技巧的研究實驗室。
快速開始
- 閱讀 快速入門指南: https://llm-d.ai/docs/getting-started/quickstart
- 從 明亮路徑 文件中選擇一個入門配方(如
optimized-baseline)。 - 使用 Helm 部署(倉儲提供版本鎖定的 Chart)。README 指向發布頁面以取得確切的 Chart 版本。
社群與貢獻
- CNCF 授權專案,擁有公開 Slack、雙週站會、SIG 與完整的貢獻指南。
- Apache 2.0 許可證 – 免費用於商業與學術用途。
以上所有資訊均直接來自倉儲的 README;未推斷任何額外功能。
相關
- 專案
- 專案
- 專案
- 專案
- 專案