ai-dynamo/dynamo
A Datacenter Scale Distributed Inference Serving Framework
解决的问题
Dynamo 是一个面向数据中心规模的编排层,旨在将多个 GPU 和节点整合为一个高性能的推理系统。它通过智能路由、解耦服务和自动扩展,克服了单节点推理引擎的局限性,从而最大化 LLM、多模态和视频生成工作负载的吞吐量,并最小化延迟。
工作原理
Dynamo 位于现有的推理引擎(如 SGLang、TensorRT-LLM 和 vLLM)之上,而非取代它们。它结合使用 Rust 以实现高性能,Python 以实现可扩展性,实现了多个核心机制:
- 解耦服务: 将推理的预填充(prefill)和解码(decode)阶段分离为可独立扩展的 GPU 池。
- KV感知路由: 基于工作节点负载和 KV 缓存重叠情况路由请求,消除冗余的预填充计算。
- KV 块管理器(KVBM): 将 KV 缓存卸载到 GPU、CPU、SSD 和远程存储,以延长上下文长度。
- ModelExpress: 通过 NIXL/NVLink 在 GPU 之间流式传输模型权重,实现更快的冷启动。
- SLA 基于规划器: 一个自动扩缩器,通过分析工作负载来合理配置 GPU 池,以满足延迟目标。
- Grove: 用于 NVL72 系统上拓扑感知的群组调度的 Kubernetes Operator。
适用对象
适用于在多个 GPU 或节点上部署 LLM 的开发者和运维人员,他们需要满足严格的延迟 SLA,降低总体拥有成本(TCO),并能独立扩展预填充和解码阶段。
主要亮点
- 高性能: 在特定硬件上,DeepSeek-R1 的吞吐量最高提升 750 倍。
- 引擎无关: 支持 SGLang、TensorRT-LLM 和 vLLM 后端。
- 零配置部署: Beta 功能,仅需一个 YAML 文件指定模型、硬件和 SLA 即可完成部署。
- OpenAI 兼容: 提供 OpenAI 兼容 API,便于集成。
- 容错能力: 包含金丝雀健康检查和运行中请求迁移,确保系统可靠性。
相关
- 项目
- 项目
- 项目
- 项目
- 项目