AstraNetLab/CacheRoute
CacheRoute is an innovative LLM scheduling scheme dedicated to enabling flexible KV cache reuse across LLM systems, improving task performance and system efficiency.
解决的问题
CacheRoute 通过在多个 LLM 请求反复使用相同长篇外部知识文本时减少沉重的预填充开销和冗余计算。它不每次都重新计算这些提示,而是允许在不同 LLM 系统之间重用键值(KV)缓存,从而降低延迟并提高吞吐量。
工作原理
基于 vLLM 和 LMCache 构建,CacheRoute 实现了知识分发网络(KDN)架构。它使用专用的 KDN 服务器来存储和管理热门知识的 KV 缓存块。
当请求到达时,系统遵循以下工作流程:
- 调度器:分析知识需求,并将请求路由到最高效的资源池。
- 代理:预测基于文本与基于 KV 缓存注入的成本,并根据实时计算和网络负载动态选择最佳策略。
- KDN 服务器:如果选择了重用策略,则注入预计算的 KV 缓存块。
- 实例:将请求转发给 vLLM 和 LMCache 后端以进行最终执行。
适用对象
专为知识密集型 LLM 服务设计,例如基于浏览器的 AI 助手和基于知识的问答系统,这些系统中相同参考材料被众多用户频繁访问。
主要亮点
- 计算-网络协同:根据当前系统负载,在重新计算和缓存注入之间动态切换。
- 跨系统重用:通过 KDN 服务器在不同 LLM 系统之间共享可重用知识。
- 知识导向路由:基于知识可用性和系统拓扑结构路由请求。
- 可观测性工具:包含代理浏览器 UI 和实例资源仪表板,用于监控控制平面状态和资源快照。
相关
- 项目
- 项目
- 项目
- 项目