使用 vLLM x Mooncake 大規模服務 Agentic 工作負載

Agentic 工作負載會產生大量可重複使用的前綴 Agentic 工作負載會產生高重複使用的長上下文,使前綴緩存變得至關重要。 Codex/SWE‑bench Pro 追蹤顯示,在第 30 輪時,上下文長度達到約 80 K 個 token,且可能超過 180 K 個 token,而每輪僅增加幾百到幾千個新 token。 在 610 個追蹤中,每個追蹤的中位數為 33 輪,數據集表現如下:

  • 94.2 % 快取命中率
  • 131:1 輸入‑輸出 token 比率
  • 每輪平均上下文增長約 2 242 個 token
  • 每個追蹤的中位數上下文增長從 12 K 增至 80 K 個 token
  • 輪間延遲從中位數 5.2 s 到 P99 81.4 s 這些數據證明,輸入的大部分是可重複使用的前綴,因此快取它可以消除冗餘的預填充。

使用 Mooncake Store 的分散式 KV 快取池解決前綴共享

整合 Mooncake Store 提供了一個共享的 KV 快取,提高命中率並實現跨實例重複使用。 Mooncake 是一個用於 KV 快取傳輸和分散式存儲的開源庫。 vLLM 已經透過 MooncakeConnector 使用 Mooncake 進行 prefill‑decode 分離。 新的整合建立了一個分散式 KV 快取池,其中多個 vLLM 實例嵌入 Mooncake 客戶端並連接到範圍廣泛的 Mooncake Store 主節點。 主節點管理 KV‑block 中繼資料、服務發現和客戶端健康狀態;工作節點透過 RDMA 在 GPU HBM 與分散式 DRAM/SSD 池之間傳輸 KV 塊。 在調度器端,vLLM 對提示 token 塊進行雜湊,向 Mooncake 主節點查詢匹配的 KV 快取塊,並利用結果來指導調度。 在工作節點端,每個 GPU 工作節點運行一個 Mooncake 客戶端,將 GPU KV 快取記憶體註冊為 RDMA 緩衝區,並透過背景 I/O 執行緒移動資料。

設計亮點:無 SM 的 GPUDirect RDMA、異步傳輸、MultiConnector

該實作使用 GPUDirect RDMA 進行零複製,在背景 I/O 執行緒上運行傳輸,並透過 MultiConnector 進行 PD 分離。 KV 塊移動利用 GPUDirect RDMA,避免暫存緩衝區和 SM 消耗,並可將多個 RNIC 共用以獲得更高頻寬。 所有 RDMA 操作在專用的背景 I/O 執行緒上運行,使傳輸路徑完全異步,並防止主 CPU 路徑出現停頓。 MultiConnector 介面鏈接子連接器;預填充實例將 KV 塊存儲在分散式池中,並可在快取命中時檢索它們,而解碼實例則將塊寫入池中以供預填充可見。

在 Codex 追蹤上的性能結果與擴展

在真實的 Agentic 追蹤上,快取命中率從 1.7 % 跳升至 92.2 %,帶來 3.8× 的吞吐量、46× 降低的 TTFT 與 8.6× 降低的延遲;擴展至 60 個 GB200 GPU 時,保持 >95 % 的命中率,並實現近似線性的吞吐增長。 在 Codex Agentic 追蹤實驗中(1P1D,12 個 GB200 GPU),分散式 KV 快取池使吞吐量提升 3.8×,P50 TTFT 降低 46×,端到端延遲減少 8.6×。 這些收益源自快取命中率從 1.7 %(僅快取系統提示)升至 92.2 %(幾乎整個前綴被快取)。 就擴展而言,使用了從 Codex 工作負載導出的合成數據集,並在節點之間採用輪詢路由。 系統在所有規模下都保持了超過 95 %的快取命中率,並從 12 個到 60 個 GB200 GPU 實現了近似線性的吞吐擴展,這表明分散式池防止了原本會降低性能的跨實例未命中。

未來工作

規劃的擴展包括分散式磁碟卸載、混合模型支援、快取感知路由以及資料路徑優化。 未來工作將把存儲層次結構擴展至 NVMe SSD 和分散式檔案系統,以獲得更大的快取容量。 將加入對具有混合注意機制的混合模型的支援,允許每層採用不同的快取策略。 快取感知路由將與 KV 快取池共同設計請求路由器,將輪次導向持有相關前綴的實例,以最大化本地命中,在必要時才回退到分散式池。 資料路徑優化將探索 NVIDIA 多節點 NVLink 和類似 DualPath 的同時從預填充和解碼實例載入 KV,以提升總體頻寬。

致謝

vLLM Mooncake Store 整合受到 vLLM‑Ascend 先前工作的啟發。 感謝 Ant Group 的 Chao Lei 提供初步實作,以及 Inferact 的 Zijing Liu 提供 Agentic 追蹤和分析。 此外,還感謝 Approaching.AI 的 Jiahao Lu、Zuoyuan Zhang、Zihan Tang、Ke Yang;華為的 Pengbo Zhao、Fuqiao Duan、Tianyu Xu;阿里雲計算的 Tianchen Ding、Xuchun Shang、Xingrui Yi、Teng Ma;Ant Group 的 Yunxiao Ning、Dejiang Zhu、Shoujian Zheng;以及 9#AISoft 的 Feng Ren 提供技術回饋。 更廣泛的 vLLM 和 Mooncake 社區因其支持而受到肯定,同時 Inferact 團隊也因緊密合作而受到感謝。

Sources

相關

  • 專案
  • Dispatch
  • Dispatch
  • Dispatch