FutureMLS-Lab/OSCAR
OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization
해결하는 문제
OSCAR는 대규모 언어 모델에서 KV(Key-Value) 캐시의 높은 메모리 오버헤드를 해결합니다. 이는 종종 컨텍스트 길이와 처리량을 제한합니다. 복잡한 추론 및 코딩 작업에서 다른 2비트 방법이 일반적으로 실패하는 상황에서도, 원래의 16비트(BF16) 정밀도에 근접한 정확도를 유지하면서 KV 캐시의 2비트 양자화(INT2)를 가능하게 합니다.
작동 방식
OSCAR는 모델이 실제로 주의 메커니즘을 어떻게 사용하는지 분석하기 위한 오프라인 캘리브레이션 프로세스를 사용합니다. 작은 데이터셋에서 활성화를 캡처하여 키와 값에 대한 '주의에 기반한' 공분산 구조를 추정합니다. 이를 바탕으로 각 레이어별 직교 회전과 클리핑 임계값을 도출하여 양자화 프로세스를 모델이 정확도를 위해 가장 필요로 하는 방향에 맞춥니다.
품질을 추가로 보호하기 위해, 미스프리시전 전략을 사용합니다. 초기 토큰의 작은 '싱크'와 최근 토큰 윈도우는 BF16으로 유지되며, 캐시의 대부분은 INT2로 저장됩니다. 이는 고성능을 위한 융합된 미스프리시전 Flash-Attention 커널을 통해 구현됩니다.
대상 사용자
- LLM 배포자: 제한된 하드웨어에서 컨텍스트 길이를 크게 늘리거나 더 큰 배치 크기를 지원하기 위해 KV 캐시 메모리를 약 8배 줄이고자 하는 사용자.
- 로컬 LLM 사용자: 소비자용 하드웨어(예: MacBook)에서 Qwen3-32B와 같은 대규모 모델을 긴 컨텍스트 윈도우로 실행하고자 하는 사용자.
- ML 연구자: KV 캐시 양자화 및 효율적인 추론 엔진 개발에 종사하는 개발자.
주요 특징
- 극한의 압축: BF16 대비 KV 캐시 메모리를 약 8배 감소.
- 성능 향상: 대규모 배치 크기에서 최대 7배의 처리량 향상, 배치 크기 1에서는 최대 3배의 빠른 디코딩.
- 프레임워크 통합: SGLang 및 llama.cpp(특정 포크를 통해)에 내장됨.
- 고정밀도: 나이브한 2비트 양자화가 일반적으로 실패하는 추론 벤치마크(GPQA, HumanEval)에서 BF16에 근접한 품질 유지.
- 회전 자료집: Hugging Face에 사전 계산된 캘리브레이션된 회전을 제공하여 사용자가 캘리브레이션 단계를 건너뛸 수 있음.
관련
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch