quantumaikr/quant.cpp
LLM inference with 7x longer context. Pure C, zero dependencies. Lossless KV cache compression + single-header library.
What it solves
quant.cpp는 소비자용 하드웨어에서 큰 컨텍스트 윈도우의 메모리 병목 현상을 해결합니다. 16GB Mac과 같은 기기에서 문서 전체를 모델의 컨텍스트 윈도우에 로드할 수 있게 함으로써, 중간 크기 문서에 대한 청크 기반 검색 증강 생성(RAG)의 필요성을 제거하고, RAG가 잘못된 문서 섹션을 검색할 때 발생하는 "silent hallucinations"의 위험을 줄입니다.
How it works
이 프로젝트는 고효율 KV (Key-Value) cache 압축을 구현합니다. 가장 최근의 ~128개 토큰은 전체 FP32 정밀도로 유지하고 나머지는 압축(최대 6.4배)하는 "progressive" 압축 전략을 사용합니다. 이는 Transformer attention이 일반적으로 가장 최근의 토큰에 집중된다는 사실에 부합합니다. 또한 모델의 유효 작업 메모리 한계(working memory cliff)를 넘어서는 문서를 처리하기 위한 RLV (Read-Locate-Verify)라는 특화된 5단계 파이프라인을 제공합니다.
Who it’s for
무거운 GPU 인프라나 복잡한 RAG 파이프라인에 의존하지 않고, 소비자용 노트북(특히 macOS 및 Linux)에서 긴 문맥의 LLM을 실행하고자 하는 개발자와 AI 연구자.
Highlights
- High Compression: 최대 6.4배의 KV 압축을 달성하여 16GB Mac에서 128K 컨텍스트를 가능하게 합니다.
- FP32 Quality: 소수의 토큰 윈도우를 전체 정밀도로 유지하여 FP32에 가까운 품질을 유지합니다.
- Zero Dependencies: 17.6K 행의 C 언어로 작성되었으며 외부 의존성이 없습니다.
- OpenAI Compatible: OpenAI 호환 HTTP API를 제공하는 서버 모드를 포함합니다.
- RLV Pipeline: 작은 모델의 "working memory cliff"를 bypass를 통해 통해 긴 텍스트에 대한 정확도를 유지하는 Read-Locate-Verify 시스템입니다.