xiaol/wkvm
Inference for hybrid LLMs: Gemma, RWKV, and all kinds of hybrids.
解決的問題
WKVM 是為線性與混合線性模型(例如 RWKV-7、GDN 和 Mamba2)設計的模型狀態虛擬化平台。它以固定大小的請求級狀態槽取代傳統上記憶體消耗較高的分頁 KV 塊鏈,從而實現每個請求極小且恆定的記憶體開銷,簡化排程流程,並支援高階狀態管理。
工作原理
WKVM 不再管理複雜的 KV 快取,而是將模型狀態視為虛擬機。為每個請求分配固定大小的狀態槽,使引擎能夠執行建立、快照、分叉、休眠和恢復狀態等操作。對於混合模型,全注意力層在簡單的分頁來賓池中處理。其「持久狀態 API」支援狀態句柄命名、版本化,並可在 GPU、主機記憶體和 NVMe 之間跨儲存層級導出。
適用對象
適用於需要高吞吐量推論、高效狀態管理,並能以極低記憶體開銷處理數千個並發會話的遞迴或線性注意力模型開發者與研究人員。
核心亮點
- 狀態原生推論:將模型狀態視為可遷移、可分叉、可休眠的一等物件。
- 持久狀態 API:支援命名、版本化、可變的狀態句柄,可儲存於 GPU、固定主機記憶體和 NVMe 中。
- 高吞吐效能:在特定線性/混合模型工作負載中,相比 vLLM 和 SGLang 显著提升吞吐量。
- 高效排程:採用無階段的連續批次排程器,基於空閒槽位計數實現精確准入。
相關
- 專案
- 專案
- 專案
- 專案
- Dispatch