sqliteai/warp
Run the full 2.78-trillion-parameter Kimi K3 model or GLM-5.3-Flash beyond available RAM by streaming activated weights directly from NVMe. A dependency-free, embeddable C inference engine.
解决的问题
WARP(Weight-Aware Runtime and Paging)是一种嵌入式推理引擎,旨在让像 2.78 万亿参数的 Kimi K3 这样的大型前沿模型在消费级硬件上运行。它通过将高速本地存储(NVMe SSD)作为主要权重仓库,解决了超大混合专家(MoE)模型的内存瓶颈问题,即使模型权重超过可用 RAM 也能运行。
工作原理
WARP 将模型的共享「主干」保留在 RAM 中,同时仅从磁盘直接流式传输每个 token 所需的特定专家。为优化性能,它采用了多种技术:
- 专家缓存:利用未使用的 RAM 作为有界缓存,存储频繁访问的专家,减少磁盘读取次数。
- 前瞻路由:路由器预测下一层将需要哪些专家,并在实际需要前就开始从磁盘读取。
- 对齐读取:模型容器结构经过优化,使一个专家恰好对应一次对齐读取,从而将磁盘 I/O 与计算重叠。
- 量化:专家使用 3 位残差向量量化,共享权重使用 4 位或 8 位。
- 高效注意力:采用线性注意力和压缩的潜在 KV 缓存,保持低内存占用(例如,K3 在 4K 上下文时仅需 0.21 GB)。
适用人群
适用于希望在 RAM 有限(例如 16 GB 到 64 GB)的机器上,使用高速 NVMe 存储本地运行万亿参数多模态模型的开发者和研究人员。
亮点
- 支持超大规模模型:可运行 Kimi K3(2.78T 参数)和 GLM-5.3-Flash(313B 参数)。
- 零依赖:使用 C 语言编写,无第三方运行时依赖(推理无需 BLAS、CUDA 或 Python)。
- 多模态能力:支持 Kimi K3 和 GLM-5.3-Flash 的文本和图像输入。
- 硬件高效:可在仅 16 GB RAM 的机器上运行 313B 模型。
- 广泛兼容:支持 macOS、Linux(arm64/x86_64)和 Windows(通过 MinGW-w64)。
相关
- Dispatch
- 项目
- 项目
- 项目
- Dispatch