quantumaikr/quant.cpp

LLM inference with 7x longer context. Pure C, zero dependencies. Lossless KV cache compression + single-header library.

What it solves

quant.cpp は、コンシューマー向けハードウェアにおける大きなコンテキストウィンドウのメモリボトルネックを解決します。16GB Mac などのデバイスでドキュメント全体をモデルのコンテキストウィンドウにロードできるため、中規模のドキュメントに対してチャンクベースのRAG(Retrieval-Augmented Generation)の必要性を排除し、RAG が誤ったセクションを検索してしまうことで発生する「サイレント・ハルシネーション(静かな幻覚)」のリスクを低減します。

How it works

このプロジェクトは、高効率な KV (Key-Value) cache 圧縮を実装しています。「プログレッシブ」圧縮戦略を採用しており、直近の ~128 トークンはフル FP32 精度で保持し、残りのトークンは圧縮(最大 6.4 倍)します。これは、Transformer の Attention メカニズムが通常、直近のトークンに集中することに基づいています。また、モデルの有効な作業メモリの限界(メモリ・クリフ)を回避するための、RLV (Read-Locate-Verify) と呼ばれる特化型の 5 ステップ・パイプラインを搭載しています。

Who it’s for

重い GPU インフラストラクチャや複雑な RAG パイプラインに頼らず、コンシューマー向けノート PC(特に macOS と Linux)で長文コンテキスト LLM を実行したい開発者や AI 研究者。

Highlights

  • High Compression: 最大 6.4 倍の KV 圧縮を実現し、16GB Mac で 128K コンテキストを可能にします。
  • FP32 Quality: 少数のトークンウィンドウをフル精度で保持することで、FP32 に近い品質を維持します。
  • Zero Dependencies: 17.6K 行の C 言語で記述されており、外部依存関係がありません。
  • OpenAI Compatible: OpenAI 互換の HTTP API を提供するサーバーモードが含まれています。
  • RLV Pipeline: Read-Locate-Verify システムにより、小規模モデルの「作業メモリの限界」を回避し、長いテキストに対する精度を維持します。