rednote-machine-learning/RedKnot
Efficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention
해결하는 문제
RedKnot은 긴 컨텍스트를 통한 대규모 언어 모델(LLM) 서빙과 관련된 높은 계산 비용 및 지연 시간을 해결합니다. 특히 첫 번째 토큰 생성 시간(TTFT)과 산술 계산 요구 사항을 목표로 하여, 긴 컨텍스트 요청의 프리필(prefill) 단계에서 발생하는 중복 작업을 줄입니다.
작동 방식
RedKnot은 SGLang을 기반으로 구축된 모델 인식 실행 프레임워크로, 긴 컨텍스트 서빙을 최적화하기 위해 세 가지 주요 메커니즘을 사용합니다:
- Head Decomposition and Aggregation: 어텐션 헤드를 재사용 가능한 로컬 헤드(오프라인에서 준비됨)와 온라인 글로벌/리트리벌 헤드로 분류합니다. 외부 인터페이스를 변경하지 않고 모델에 다시 병합되므로 MLA, MHA, GQA, sliding-window attention과 같은 다양한 어텐션 메커니즘을 지원합니다.
- Sparse FFN and MoE Execution: 토큰 수준의 중요도를 사용하여 어떤 행이 Feed-Forward Network(FFN)에 들어갈지 결정하며, Mixture-of-Experts(MoE) 모델의 경우 적응형 전문가 Top-K 선택 방식을 사용하여 토큰당 활성화되는 전문가 수를 줄입니다.
- SegPagedAttention: 헤드 및 세그먼트별로 KV 페이지와 가시성을 구성하여, 서로 다른 유형의 헤드(글로벌, 로컬, 리트리벌)가 균일한 캐시 레이아웃을 요구하지 않고도 서로 다른 컨텍스트 범위를 소비할 수 있도록 합니다.
대상 사용자
고성능 LLM 서빙 인프라를 연구하거나 개발하는 개발자와 연구자, 특히 긴 컨텍스트 RAG(Retrieval-Augmented Generation) 시나리오에서 DeepSeek-V4-Flash, Mistral, Qwen, Llama 3.3과 같은 모델을 배포하는 사용자를 대상으로 합니다.
주요 특징
- Performance Gains: 핫 스테이트(hot-state) TTFT에서 2
5배의 속도 향상을 목표로 하며, 산술 계산 비용을 7090% 절감합니다. - LMM Support: SGLang을 기반으로 구축되었으며 DeepSeek, Mistral, Qwen, Llama를 포함한 광범위한 아키텍처를 지원합니다.
- Hardware Compatibility: NVIDIA H200/B300 GPU에 최적화되어 있으며, Huawei Ascend NPU에 대한 지속적인 적응 작업을 진행 중입니다.
- Reproducible Benchmarks: 다양한 컨텍스트 길이(64K에서 440K까지)에 걸쳐 DeepSeek-V4-Flash에 대한 패키지화된 재현 경로를 제공합니다.
관련
- 프로젝트
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트