sqliteai/warp

Run the full 2.78-trillion-parameter Kimi K3 model or GLM-5.3-Flash beyond available RAM by streaming activated weights directly from NVMe. A dependency-free, embeddable C inference engine.

解決的問題

WARP(Weight-Aware Runtime and Paging)是一種可嵌入的推論引擎,專為在消費級硬體上執行大型前沿模型(如 2.78 兆參數的 Kimi K3)而設計。它透過將高速本地儲存(NVMe SSD)作為主要權重儲存庫,解決了巨大混合專家(MoE)模型的記憶體瓶頸問題,即使模型權重超過可用 RAM 也能執行。

工作原理

WARP 將模型的共享「主幹」保留在 RAM 中,同時僅從磁碟直接串流傳輸每個 token 所需的特定專家。為優化效能,它採用多項技術:

  • 專家快取:利用未使用的 RAM 作為有界快取,儲存頻繁存取的專家,減少磁碟讀取次數。
  • 前瞻路由:路由器預測下一層將需要哪些專家,並在實際需要前就開始從磁碟讀取。
  • 對齊讀取:模型容器結構經過優化,使一個專家恰好對應一次對齊讀取,從而將磁碟 I/O 與運算重疊。
  • 量化:專家使用 3 位殘差向量量化,共享權重使用 4 位或 8 位。
  • 高效注意力:採用線性注意力與壓縮的潛在 KV 快取,保持低記憶體需求(例如,K3 在 4K 上下文時僅需 0.21 GB)。

適用對象

適用於希望在 RAM 有限(例如 16 GB 至 64 GB)的機器上,使用高速 NVMe 儲存本地執行兆參數多模態模型的開發者與研究人員。

特色

  • 支援超大模型:可執行 Kimi K3(2.78T 參數)與 GLM-5.3-Flash(313B 參數)。
  • 零依賴:以 C 語言撰寫,無第三方執行時依賴(推論無需 BLAS、CUDA 或 Python)。
  • 多模態能力:支援 Kimi K3 與 GLM-5.3-Flash 的文字與影像輸入。
  • 硬體高效:可在僅 16 GB RAM 的機器上執行 313B 模型。
  • 廣泛相容:支援 macOS、Linux(arm64/x86_64)與 Windows(透過 MinGW-w64)。

相關

  • Dispatch
  • 專案
  • 專案
  • 專案
  • Dispatch