ai-dynamo/dynamo
A Datacenter Scale Distributed Inference Serving Framework
解決的問題
Dynamo 是一個面向資料中心規模的編排層,旨在將多個 GPU 和節點整合為單一高效率的推論系統。它透過智慧路由、解耦式服務與自動擴展,克服單一節點推論引擎的限制,從而最大化 LLM、多模態與影片生成工作負載的吞吐量,並最小化延遲。
工作原理
Dynamo 位於現有的推論引擎(如 SGLang、TensorRT-LLM 和 vLLM)之上,而非取代它們。它結合使用 Rust 以實現高效能,Python 以實現可擴展性,實現多個核心機制:
- 解耦式服務: 將推論的預填入(prefill)與解碼(decode)階段分離為可獨立擴展的 GPU 池。
- KV 感知路由: 基於工作節點負載與 KV 快取重疊情況路由請求,消除冗餘的預填入計算。
- KV 塊管理器(KVBM): 將 KV 快取卸載至 GPU、CPU、SSD 與遠端儲存,以延長上下文長度。
- ModelExpress: 透過 NIXL/NVLink 在 GPU 之間串流傳輸模型權重,實現更快的冷啟動。
- SLA 基礎規劃器: 一個自動擴展器,透過分析工作負載來合理配置 GPU 池,以達成延遲目標。
- Grove: 用於 NVL72 系統上拓撲感知群組排程的 Kubernetes Operator。
適用對象
適用於在多個 GPU 或節點上部署 LLM 的開發者與運維人員,他們需要滿足嚴格的延遲 SLA,降低總擁有成本(TCO),並能獨立擴展預填入與解碼階段。
主要亮點
- 高效率: 在特定硬體上,DeepSeek-R1 的吞吐量最高提升 750 倍。
- 引擎無關: 支援 SGLang、TensorRT-LLM 與 vLLM 後端。
- 零設定部署: Beta 功能,僅需一個 YAML 檔案指定模型、硬體與 SLA 即可完成部署。
- OpenAI 兼容: 提供 OpenAI 兼容 API,便於整合。
- 容錯能力: 包含金絲雀健康檢查與執行中請求遷移,確保系統可靠性。
相關
- 專案
- 專案
- 專案
- 專案
- 專案