WeianMao/triattention
TriAttention — Efficient long reasoning with trigonometric KV cache compression. Enables OpenClaw local deployment on memory-constrained GPUs.
해결하는 문제
TriAttention은 긴 추론(long-reasoning) LLM의 KV (Key-Value) 캐시에서 발생하는 높은 메모리 오버헤드와 느린 처리량 문제를 해결합니다. 정확도를 희생하지 않으면서 긴 추론 작업에서 KV 캐시의 메모리 점유율을 최대 10.7배 줄이고 처리량을 최대 2.5배 증가시킵니다.
작동 원리
TriAttention은 대표적인 쿼리를 선택하여 키를 점수화하는 대신 삼각함수 주파수 영역 압축을 사용합니다. 긴 추론 모델의 RoPE 적용 전 Q/K 벡터가 삼각 급수를 통해 거리 선호도를 결정하는 고정된 중심 주변에 집중되어 있다는 점을 식별했습니다. 이러한 중심점과 노름(norm)을 사용하여 키를 점수화함으로써, 기존의 어텐션 기반 방식의 오버헤드 없이 정확한 KV 캐시 압축을 가능하게 합니다.
대상
긴 컨텍스트 LLM을 다루는 개발자와 연구자, 특히 Qwen3 및 DeepSeek-R1과 같은 모델을 배포하면서 소비자용 GPU (RTX 4090 등)부터 NVIDIA DGX 시스템 및 Apple Silicon Mac에 이르는 하드웨어에서 VRAM 사용량을 줄이고 추론 속도를 높여야 하는 분들을 위한 솔루션입니다.
주요 특징
- 획기적인 효율성 향상: AIME25 벤치마크에서 KV 메모리 10.7배 감소 및 처리량 2.5배 향상을 달성했습니다.
- 폭넓은 통합: NVIDIA TensorRT-LLM에 공식 통합되었으며 vLLM 및 SGLang 백엔드를 지원합니다.
- 하드웨어 범용성: Apple Silicon (MLX를 통해) 및 AMD GPU (커뮤니티 ggml 포트를 통해)와 호환됩니다.
- 추론 중심: AIME24, AIME25, MATH-500과 같은 복잡한 추론 데이터셋에서 전체 어텐션 정확도를 유지합니다.
관련
- 프로젝트
- 프로젝트
- Dispatch
- 프로젝트
- 프로젝트