llm-d/llm-d

Achieve state of the art inference performance with modern accelerators on Kubernetes

llm‑d – 在 Kubernetes 上實現高效率分散式 LLM 推論

是什麼

  • 一個開源堆疊,位於 vLLMSGLang 等模型伺服器之上,為大語言模型(LLM)推論添加生產級的編排、路由與快取管理功能。
  • 專為雲原生環境(Kubernetes、Helm)設計,由 Red Hat、Google Cloud、IBM Research、CoreWeave 與 NVIDIA 共同創立的 CNCF Sandbox 專案支援。

核心功能

領域 llm‑d 增強的功能
智慧路由 支援前綴快取感知與負載感知的負載平衡;實驗性延遲預測排程器可降低延遲並提升吞吐量。
KV 快取管理 將注意力 KV 快取分層卸載至 CPU 或磁碟,透過全域索引支援多輪請求保持更大的工作集。
大模型服務 支援預填入/解碼解耦與 廣域專家平行,可將超大型模型(如 DeepSeek‑R1、GPT‑OSS‑120B)分佈於高速互連上。
運維卓越 支援多租戶流量的流量控制、SLO 感知自動伸縮,以及主動-主動高可用,確保大規模服務穩定。
批次處理 提供 OpenAI 相容的批次 API 與非同步流水線,適用於離線工作負載,最大化硬體利用率。

效能亮點(來自 README 報告)

  • 使用前綴快取路由的 Llama 3.1 70B 上,輸出吞吐量提升 3 倍,首次輸出時間(TTFT)縮短 2 倍(4× AMD MI300X)。
  • 在 NVIDIA GPU 上使用預測延遲排程,TTFT/ITL 降低 40%。
  • 透過預填入/解碼解耦,GPT‑OSS 在 AWS B200 上實現每秒最多多出 70% 的 token。
  • 在 16×16 NVIDIA B200 網格上使用廣域專家平行,叢集吞吐量達 50k token/秒。

如何使用

  1. 部署 – 按照快速入門指南,在 Kubernetes 集群(任意雲或本地)上安裝 Helm Chart。該堆疊會自動部署路由器、快取管理器與模型伺服器 Pod。
  2. 設定 – 根據模型大小與硬體加速器(NVIDIA、AMD、Intel、Google TPU 等)選擇一條「明亮路徑」(如 Optimized BaselineTiered Prefix CacheWide Expert-Parallelism)。
  3. 執行 – 透過提供的 OpenAI 相容 REST 端點或批次 API 發送推論請求。llm‑d 將自動路由流量、管理 KV 快取層級,並根據即時延遲信號動態伸縮 Pod。
  4. 監控 – 內建 Prometheus 指標與 SLO 感知自動伸縮功能,可即時監控吞吐量、延遲與資源使用率。

誰會受益

  • 需要以低延遲與可預測成本服務大量並發 LLM 使用者的企業。
  • 希望在異構加速器上以可重現、雲原生方式執行最進階模型的 ML-ops 團隊。
  • 希望無需手動調校 Kubernetes 部署即可基準測試新模型或推論技巧的研究實驗室。

快速開始

  • 閱讀 快速入門指南https://llm-d.ai/docs/getting-started/quickstart
  • 明亮路徑 文件中選擇一個入門配方(如 optimized-baseline)。
  • 使用 Helm 部署(倉儲提供版本鎖定的 Chart)。README 指向發布頁面以取得確切的 Chart 版本。

社群與貢獻

  • CNCF 授權專案,擁有公開 Slack、雙週站會、SIG 與完整的貢獻指南。
  • Apache 2.0 許可證 – 免費用於商業與學術用途。

以上所有資訊均直接來自倉儲的 README;未推斷任何額外功能。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案