quantumaikr/quant.cpp

LLM inference with 7x longer context. Pure C, zero dependencies. Lossless KV cache compression + single-header library.

What it solves

quant.cpp 解决了消费级硬件上大上下文窗口的内存瓶颈。它通过让用户在 16GB Mac 等设备上将整个文件载入到模型的上下文窗口中,消除了对中型文件进行基于分块的检索增强生成 (RAG) 的 媒体 需求,从而降低了 RAG 在检索到错误文件章节时可能产生的“静默幻觉”风险。

How it works

该项目实施了高效能的 KV (Key-Value) cache 压缩。它采用“渐进式”压缩策略,将最近的 ~128 个 token 保持在完整的 FP32 精度,而其余部分则进行压缩(最高可达 6.4x),这与 transformer attention 集中在最近 token 的特性相符。此外,它还包含一个名为 RLV (Read-Locate-Verify) 的专用 5 阶段流水线,用以处理超过模型有效工作内存临界点的文件。

Who it’s for

想要在消费级笔记本电脑(特别是在 macOS 和 Linux)上运行长文本 LLM,且不想依赖沉重的 GPU 基础设施或针对单一文件分析进行复杂的 RAG 流水线开发人员和 AI 研究人员。

Highlights

  • High Compression: 实现了高达 6.4x 的 KV 压缩,使 16GB Mac 可以在 128K 上下文下运行。
  • FP32 Quality: 通过保持一小部分 token 窗口的完整精度,维持了接近 FP32 的质量。
  • Zero Dependencies: 使用 17.6K 行 C 语言编写,无外部依赖。
  • OpenAI Compatible: 包含一个提供 OpenAI 兼容性 HTTP API 的服务器模式。
  • RLV Pipeline: 一个 Read-Locate-Verify 系统,可以绕过小模型的工作内存临界点,在处理长文本时维持准确性。"},