quantumaikr/quant.cpp

LLM inference with 7x longer context. Pure C, zero dependencies. Lossless KV cache compression + single-header library.

What it solves

quant.cpp 解決了消費級硬體上大上下文窗口的記憶體瓶頸。它透過讓使用者在 16GB Mac 等設備上將整個文件載入到模型的上下文窗口中,消除了對中型文件進行基於分塊的檢索增強生成 (RAG) 的需求,從而降低了 RAG 在檢索到錯誤文件章節時可能產生的「靜默幻覺」風險。

How it works

該專案實作了高效能的 KV (Key-Value) cache 壓縮。它採用「漸進式」壓縮策略,將最近的 ~128 個 token 保持在完整的 FP32 精度,而其餘部分則進行壓縮(最高可達 6.4x),這與 transformer attention 集中在最近 token 的特性相符。此外,它還包含一個名為 RLV (Read-Locate-Verify) 的專用 5 階段流水線,用以處理超過模型有效工作記憶體臨界點的文件。

Who it’s for

想要在消費級筆記型電腦(特別是 macOS 和 Linux)上運行長文本 LLM,且不想依賴沉重的 GPU 基礎設施或針對單一文件分析進行複雜的 RAG 流水線的開發者和 AI 研究人員。

Highlights

  • High Compression: 實現了高達 6.4x 的 KV 壓縮,讓 16GB Mac 可以在 128K 上下文下運行。
  • FP32 Quality: 透過保持一小部分 token 窗口的完整精度,維持了接近 FP32 的品質。
  • Zero Dependencies: 使用 17.6K 行 C 語言編寫,無外部依賴。
  • OpenAI Compatible: 包含一個提供 OpenAI 相容性 HTTP API 的伺服器模式。
  • RLV Pipeline: 一個 Read-Locate-Verify 系統,可以繞過小模型的工作記憶體臨界點,在處理長文本時維持精確度。"},