ModelEngine-Group/unified-cache-management
Persist and reuse KV Cache to speedup your LLM.
解决的问题
Unified Cache Manager (UCM) 解决了大语言模型(LLM)中 KV 缓存带来的高 GPU 内存消耗和计算冗余问题,尤其是在长序列推理场景下。通过将 KV 缓存卸载到外部存储,并利用高效的检索机制减少冗余计算,UCM 有效缓解了 GPU 内存瓶颈。
工作原理
UCM 实现了一种存储-计算分离架构,用于持久化 LLM 的 KV 缓存。其采用模块化框架设计,不同稀疏注意力算法可通过基类 UcmSparseBase 轻松集成。SparseKVManager 负责自定义块分配,而 KVStoreBase 将稀疏算法与物理存储(如本地文件系统或 NFS)解耦,从而实现 GPU 内存与外部存储之间的灵活数据迁移。
适用人群
本项目专为使用 LLM 推理引擎(特别是 vLLM)的开发者和研究人员设计,适用于需要优化多轮对话、长上下文推理,以及在异构计算资源环境下运行的场景。
核心亮点
- 前缀缓存:支持持久化和重用常见提示前缀,避免重复计算。
- 稀疏注意力:提供无需训练的稀疏注意力检索方法,显著提升超长序列上的性能。
- PD 解耦:提供预填充-解码(PD)解耦方案,更高效地管理异构计算资源。
- vLLM 集成:与 vLLM 集成后,可实现 3-10 倍的推理延迟降低。
- 灵活存储:支持多种外部存储选项,包括多服务器环境中的 NFS。
相关
- 项目
- 项目
- 项目
- 项目
- 项目