ai-dynamo/dynamo

A Datacenter Scale Distributed Inference Serving Framework

解决的问题

Dynamo 是一个面向数据中心规模的编排层,旨在将多个 GPU 和节点整合为一个高性能的推理系统。它通过智能路由、解耦服务和自动扩展,克服了单节点推理引擎的局限性,从而最大化 LLM、多模态和视频生成工作负载的吞吐量,并最小化延迟。

工作原理

Dynamo 位于现有的推理引擎(如 SGLang、TensorRT-LLM 和 vLLM)之上,而非取代它们。它结合使用 Rust 以实现高性能,Python 以实现可扩展性,实现了多个核心机制:

  • 解耦服务: 将推理的预填充(prefill)和解码(decode)阶段分离为可独立扩展的 GPU 池。
  • KV感知路由: 基于工作节点负载和 KV 缓存重叠情况路由请求,消除冗余的预填充计算。
  • KV 块管理器(KVBM): 将 KV 缓存卸载到 GPU、CPU、SSD 和远程存储,以延长上下文长度。
  • ModelExpress: 通过 NIXL/NVLink 在 GPU 之间流式传输模型权重,实现更快的冷启动。
  • SLA 基于规划器: 一个自动扩缩器,通过分析工作负载来合理配置 GPU 池,以满足延迟目标。
  • Grove: 用于 NVL72 系统上拓扑感知的群组调度的 Kubernetes Operator。

适用对象

适用于在多个 GPU 或节点上部署 LLM 的开发者和运维人员,他们需要满足严格的延迟 SLA,降低总体拥有成本(TCO),并能独立扩展预填充和解码阶段。

主要亮点

  • 高性能: 在特定硬件上,DeepSeek-R1 的吞吐量最高提升 750 倍。
  • 引擎无关: 支持 SGLang、TensorRT-LLM 和 vLLM 后端。
  • 零配置部署: Beta 功能,仅需一个 YAML 文件指定模型、硬件和 SLA 即可完成部署。
  • OpenAI 兼容: 提供 OpenAI 兼容 API,便于集成。
  • 容错能力: 包含金丝雀健康检查和运行中请求迁移,确保系统可靠性。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目