xiaol/wkvm
Inference for hybrid LLMs: Gemma, RWKV, and all kinds of hybrids.
解决的问题
WKVM 是为线性及混合线性模型(如 RWKV-7、GDN 和 Mamba2)设计的模型状态虚拟化平台。它用固定大小的请求级状态槽替代了传统上内存占用较高的分页 KV 块链,从而实现每个请求极小且恒定的内存开销,简化调度流程,并支持高级状态管理。
工作原理
WKVM 不再管理复杂的 KV 缓存,而是将模型状态视为虚拟机。为每个请求分配固定大小的状态槽,使引擎能够执行创建、快照、分叉、休眠和恢复状态等操作。对于混合模型,全注意力层在简单的分页来宾池中处理。其「持久状态 API」支持状态句柄命名、版本化,并可在 GPU、主机内存和 NVMe 之间跨存储层级导出。
适用人群
适用于需要高吞吐量推理、高效状态管理,并能以极低内存开销处理数千个并发会话的递归或线性注意力模型开发者与研究人员。
核心亮点
- 状态原生推理:将模型状态视为可迁移、可分叉、可休眠的一等对象。
- 持久状态 API:支持命名、版本化、可变的状态句柄,可存储于 GPU、固定主机内存和 NVMe 中。
- 高吞吐性能:在特定线性/混合模型工作负载中,相比 vLLM 和 SGLang 显著提升吞吐量。
- 高效调度:采用无阶段的连续批处理调度器,基于空闲槽位计数实现精确准入。
相关
- 项目
- 项目
- 项目
- 项目
- Dispatch