sqliteai/warp
Run the full 2.78-trillion-parameter Kimi K3 model or GLM-5.3-Flash beyond available RAM by streaming activated weights directly from NVMe. A dependency-free, embeddable C inference engine.
解決的問題
WARP(Weight-Aware Runtime and Paging)是一種可嵌入的推論引擎,專為在消費級硬體上執行大型前沿模型(如 2.78 兆參數的 Kimi K3)而設計。它透過將高速本地儲存(NVMe SSD)作為主要權重儲存庫,解決了巨大混合專家(MoE)模型的記憶體瓶頸問題,即使模型權重超過可用 RAM 也能執行。
工作原理
WARP 將模型的共享「主幹」保留在 RAM 中,同時僅從磁碟直接串流傳輸每個 token 所需的特定專家。為優化效能,它採用多項技術:
- 專家快取:利用未使用的 RAM 作為有界快取,儲存頻繁存取的專家,減少磁碟讀取次數。
- 前瞻路由:路由器預測下一層將需要哪些專家,並在實際需要前就開始從磁碟讀取。
- 對齊讀取:模型容器結構經過優化,使一個專家恰好對應一次對齊讀取,從而將磁碟 I/O 與運算重疊。
- 量化:專家使用 3 位殘差向量量化,共享權重使用 4 位或 8 位。
- 高效注意力:採用線性注意力與壓縮的潛在 KV 快取,保持低記憶體需求(例如,K3 在 4K 上下文時僅需 0.21 GB)。
適用對象
適用於希望在 RAM 有限(例如 16 GB 至 64 GB)的機器上,使用高速 NVMe 儲存本地執行兆參數多模態模型的開發者與研究人員。
特色
- 支援超大模型:可執行 Kimi K3(2.78T 參數)與 GLM-5.3-Flash(313B 參數)。
- 零依賴:以 C 語言撰寫,無第三方執行時依賴(推論無需 BLAS、CUDA 或 Python)。
- 多模態能力:支援 Kimi K3 與 GLM-5.3-Flash 的文字與影像輸入。
- 硬體高效:可在僅 16 GB RAM 的機器上執行 313B 模型。
- 廣泛相容:支援 macOS、Linux(arm64/x86_64)與 Windows(透過 MinGW-w64)。
相關
- Dispatch
- 專案
- 專案
- 專案
- Dispatch