ModelEngine-Group/unified-cache-management
Persist and reuse KV Cache to speedup your LLM.
解決的問題
Unified Cache Manager (UCM) 解決了大語言模型(LLM)中 KV 快取所導致的高 GPU 記憶體消耗與計算重複問題,特別是在長序列推論情境下。透過將 KV 快取卸載至外部儲存,並利用高效能的檢索機制減少重複運算,UCM 有效緩解 GPU 記憶體瓶頸。
工作原理
UCM 實現了一種儲存-運算分離架構,用以持久化 LLM 的 KV 快取。其採用模組化框架設計,不同稀疏注意力演算法可透過基底類 UcmSparseBase 輕鬆整合。SparseKVManager 負責自訂區塊配置,而 KVStoreBase 則將稀疏演算法與實體儲存(如本機檔案系統或 NFS)分離,進而實現 GPU 記憶體與外部儲存之間的靈活資料搬移。
適用對象
本專案專為使用 LLM 推論引擎(特別是 vLLM)的開發者與研究人員設計,適用於需要優化多輪對話、長上下文推理,以及在異質運算資源環境下執行的場景。
核心亮點
- 前綴快取:支援持久化與重用常見提示前綴,避免重複運算。
- 稀疏注意力:提供無需訓練的稀疏注意力檢索方法,顯著提升超長序列上的效能。
- PD 解耦:提供預填入-解碼(PD)解耦方案,更有效率地管理異質運算資源。
- vLLM 集成:與 vLLM 集成後,可實現 3-10 倍的推論延遲降低。
- 靈活儲存:支援多種外部儲存選項,包括多伺服器環境中的 NFS。
相關
- 專案
- 專案
- 專案
- 專案
- 專案