ai-dynamo/dynamo

A Datacenter Scale Distributed Inference Serving Framework

解決的問題

Dynamo 是一個面向資料中心規模的編排層,旨在將多個 GPU 和節點整合為單一高效率的推論系統。它透過智慧路由、解耦式服務與自動擴展,克服單一節點推論引擎的限制,從而最大化 LLM、多模態與影片生成工作負載的吞吐量,並最小化延遲。

工作原理

Dynamo 位於現有的推論引擎(如 SGLang、TensorRT-LLM 和 vLLM)之上,而非取代它們。它結合使用 Rust 以實現高效能,Python 以實現可擴展性,實現多個核心機制:

  • 解耦式服務: 將推論的預填入(prefill)與解碼(decode)階段分離為可獨立擴展的 GPU 池。
  • KV 感知路由: 基於工作節點負載與 KV 快取重疊情況路由請求,消除冗餘的預填入計算。
  • KV 塊管理器(KVBM): 將 KV 快取卸載至 GPU、CPU、SSD 與遠端儲存,以延長上下文長度。
  • ModelExpress: 透過 NIXL/NVLink 在 GPU 之間串流傳輸模型權重,實現更快的冷啟動。
  • SLA 基礎規劃器: 一個自動擴展器,透過分析工作負載來合理配置 GPU 池,以達成延遲目標。
  • Grove: 用於 NVL72 系統上拓撲感知群組排程的 Kubernetes Operator。

適用對象

適用於在多個 GPU 或節點上部署 LLM 的開發者與運維人員,他們需要滿足嚴格的延遲 SLA,降低總擁有成本(TCO),並能獨立擴展預填入與解碼階段。

主要亮點

  • 高效率: 在特定硬體上,DeepSeek-R1 的吞吐量最高提升 750 倍。
  • 引擎無關: 支援 SGLang、TensorRT-LLM 與 vLLM 後端。
  • 零設定部署: Beta 功能,僅需一個 YAML 檔案指定模型、硬體與 SLA 即可完成部署。
  • OpenAI 兼容: 提供 OpenAI 兼容 API,便於整合。
  • 容錯能力: 包含金絲雀健康檢查與執行中請求遷移,確保系統可靠性。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案