llm-d/llm-d

Achieve state of the art inference performance with modern accelerators on Kubernetes

llm‑d – 在 Kubernetes 上实现高性能分布式 LLM 推理

是什么

  • 一个开源堆栈,位于 vLLMSGLang 等模型服务器之上,为大语言模型(LLM)推理添加生产级的编排、路由和缓存管理功能。
  • 专为云原生环境(Kubernetes、Helm)设计,由 Red Hat、Google Cloud、IBM Research、CoreWeave 和 NVIDIA 共同发起的 CNCF Sandbox 项目支持。

核心能力

领域 llm‑d 增强的功能
智能路由 支持前缀缓存感知和负载感知的负载均衡;实验性延迟预测调度器可降低延迟并提升吞吐量。
KV 缓存管理 将注意力 KV 缓存分层卸载到 CPU 或磁盘,通过全局索引支持多轮请求保持更大的工作集。
大模型服务 支持预填充/解码解耦和 宽专家并行,可将超大规模模型(如 DeepSeek‑R1、GPT‑OSS‑120B)分布在高速互连上。
运维卓越 支持多租户流量的流控、SLO 感知自动伸缩,以及主动-主动高可用,保障大规模服务稳定。
批量处理 提供 OpenAI 兼容的批量 API 和异步流水线,适用于离线工作负载,最大化硬件利用率。

性能亮点(来自 README 报告)

  • 使用前缀缓存路由的 Llama 3.1 70B 上,输出吞吐量提升 3 倍,首次输出时间(TTFT)缩短 2 倍(4× AMD MI300X)。
  • 在 NVIDIA GPU 上使用预测延迟调度,TTFT/ITL 降低 40%。
  • 通过预填充/解码解耦,GPT‑OSS 在 AWS B200 上实现每秒最多多出 70% 的 token。
  • 在 16×16 NVIDIA B200 网格上使用宽专家并行,集群吞吐量达 50k token/秒。

如何使用

  1. 部署 – 按照快速入门指南,在 Kubernetes 集群(任意云或本地)上安装 Helm Chart。该堆栈会自动部署路由器、缓存管理器和模型服务器 Pod。
  2. 配置 – 根据模型大小和硬件加速器(NVIDIA、AMD、Intel、Google TPU 等)选择一条“明亮路径”(如 Optimized BaselineTiered Prefix CacheWide Expert-Parallelism)。
  3. 运行 – 通过提供的 OpenAI 兼容 REST 端点或批量 API 发送推理请求。llm‑d 将自动路由流量、管理 KV 缓存层级,并根据实时延迟信号动态伸缩 Pod。
  4. 监控 – 内置 Prometheus 指标和 SLO 感知自动伸缩功能,可实时监控吞吐量、延迟和资源利用率。

谁会受益

  • 需要以低延迟和可预测成本服务大量并发 LLM 用户的企业。
  • 希望在异构加速器上以可复现、云原生方式运行最先进模型的 ML-ops 团队。
  • 希望无需手动调优 Kubernetes 部署即可基准测试新模型或推理技巧的研究实验室。

快速开始

  • 阅读 快速入门指南https://llm-d.ai/docs/getting-started/quickstart
  • 明亮路径 文档中选择一个入门配方(如 optimized-baseline)。
  • 使用 Helm 部署(仓库提供版本锁定的 Chart)。README 指向发布页面以获取确切的 Chart 版本。

社区与贡献

  • CNCF 认可项目,拥有公开 Slack、双周站会、SIG 和完整的贡献指南。
  • Apache 2.0 许可证 – 免费用于商业和学术用途。

以上所有信息均直接来自仓库的 README;未推断任何额外功能。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目