ModelEngine-Group/unified-cache-management

Persist and reuse KV Cache to speedup your LLM.

解決的問題

Unified Cache Manager (UCM) 解決了大語言模型(LLM)中 KV 快取所導致的高 GPU 記憶體消耗與計算重複問題,特別是在長序列推論情境下。透過將 KV 快取卸載至外部儲存,並利用高效能的檢索機制減少重複運算,UCM 有效緩解 GPU 記憶體瓶頸。

工作原理

UCM 實現了一種儲存-運算分離架構,用以持久化 LLM 的 KV 快取。其採用模組化框架設計,不同稀疏注意力演算法可透過基底類 UcmSparseBase 輕鬆整合。SparseKVManager 負責自訂區塊配置,而 KVStoreBase 則將稀疏演算法與實體儲存(如本機檔案系統或 NFS)分離,進而實現 GPU 記憶體與外部儲存之間的靈活資料搬移。

適用對象

本專案專為使用 LLM 推論引擎(特別是 vLLM)的開發者與研究人員設計,適用於需要優化多輪對話、長上下文推理,以及在異質運算資源環境下執行的場景。

核心亮點

  • 前綴快取:支援持久化與重用常見提示前綴,避免重複運算。
  • 稀疏注意力:提供無需訓練的稀疏注意力檢索方法,顯著提升超長序列上的效能。
  • PD 解耦:提供預填入-解碼(PD)解耦方案,更有效率地管理異質運算資源。
  • vLLM 集成:與 vLLM 集成後,可實現 3-10 倍的推論延遲降低。
  • 靈活儲存:支援多種外部儲存選項,包括多伺服器環境中的 NFS。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案