vLLM Kimi K3 지원 미리보기
vLLM Kimi K3 지원 미리보기
vLLM은 Moonshot AI의 Kimi K3에 대한 day-0 오픈소스 서빙 지원을 준비하고 있습니다. 이 통합은 모델 가중치가 2026년 7월 27일에 출시될 때 오픈소스 커뮤니티가 Kimi K3를 즉시 배포할 수 있게 합니다.
Kimi K3 아키텍처 및 서빙 영향
Kimi K3는 추론 엔진의 요구 사항을 변경하는 여러 가지 아키텍처 변화를 도입합니다. 이 모델은 1백만 토컨 컨텍스트 윈도우와 896개의 라우팅된 전문가(토큰당 16개 활성) 및 공유 전문가를 갖춘 매우 희소한 Mixture-of-Experts (MoE) 아키텍처를 특징으로 합니다.
주요 기술 사양 및 서빙 영향은 다음과 같습니다:
| 속성 | Kimi K3 구성 | 서빙 영향 |
|---|---|---|
| 모델 규모 | 2.8T 매개변수 | 대규모 전문가 병렬 처리 및 고대역폭 가속기 도메인이 필요합니다 |
| 컨텍스트 길이 | 1M 토컨 | 캐시 용량, 프리픽스 재사용, 및 프리필/디코드 분리를 우선시합니다 |
| 어텐션 | 하이브리드 KDA 및 전체 어텐션 | 반복 상태 캐시와 페이지드 KV 캐시의 동시 관리가 필요합니다 |
| 깊이 | 어텐션 잔차(AttnRes) | 교차 층 표현 읽기/쓰기를 위한 전용 커널이 필요합니다 |
| 양자화 | MXFP4 가중치 | Kimi K3의 SiTU 활성화를 지원하는 효율적인 FP4 MoE 경로가 필요합니다 |
| 멀티모달성 | 네이티브 비전 | 멀티모달 전처리 및 비전 병렬 처리 전략이 필요합니다 |
KDA를 위한 프리픽스 캐싱 해결
Kimi Delta Attention(KDA)은 재귀적이며, 이는 토큰별 KV 쌍을 유지하는 대신 행렬과 유사한 재귀 상태와 짧은 컨볼루션 상태를 진행한다는 의미입니다. 이는 엔진이 이전 상태를 재생하지 않기 위해 정확한 프리픽스 경계에서 KDA 상태를 보유해야 하므로 기존 프리픽스 캐싱에 도전을 만듭니다.
이를 해결하기 위해 vLLM은 이전에 연결되어 있던 세 가지 개념을 분리하는 설계를 구현했습니다:
- 물리적 블록 크기: GPU에서 KDA 상태와 전체 어텐션 KV의 할당.
- 스케줄러 정렬: 캐시 그룹 일관성을 보장하기 위해 실행이 중단되는 지점.
- 프리픽스 매치 단위: 공유 프리픽스의 해싱 및 매칭에 사용되는 세밀한 토큰 간격.
이 분리로 인해 vLLM은 더 큰 물리적 상태 블록 내의 세밀한 경계에서 유효한 KDA 상태를 등록할 수 있습니다. 이후 요청이 부분 블록과 일치할 때, 캐시된 상태는 사적인 대상(복사 시 쓰기)으로 복사되어 공유 프리픽스를 보존하면서 새로운 요청이 진행되도록 합니다.
성능 최적화 및 커널 작업
Kimi K3가 추론의 '핫 경로'를 변경하기 때문에, vLLM은 여러 가지 하드웨어 특화 및 아키텍처 최적화를 구현했습니다:
KDA 프리필 및 디코드
프리필은 FlashKDA와 Flash Linear Attention(FLA)을 통합하여 입력 프로젝션과 인과 컨볼루션을 융합합니다. 디코딩을 위해 vLLM은 짧은 컨볼루션, KDA 상태 업데이트, 출력 게이트, 및 정규화를 단일 작업으로 결합하여 출력 토큰당 시간(TPOT) 페널티를 줄이는 융합된 NVIDIA 커널을 사용합니다.
어텐션 잔차(AttnRes)
과도한 메모리 트래픽 없이 교차 층 표현 읽기를 처리하기 위해, vLLM은 잔차 업데이트, AttnRes 믹싱, 및 출력 RMSNorm을 융합하는 Triton 및 NVIDIA 커널을 활용합니다.
MLA 모듈 및 PD 분해
Kimi K3는 네 층마다 MLA 어텐션을 사용합니다. vLLM은 torch.compile 커스텀 퓨전을 수동으로 퓨전된 MLA 모듈로 대체했습니다. 이 모듈은 Prefill-Decode(PD) 분해 배포에 최적화된 별도의 프리필 및 디코드 경로를 특징으로 하며, 디코드 경로의 게이트 프로젝션에 대한 멀티스트림 지원을 포함합니다.
MXFP4 MoE 및 하드웨어 지원
Kimi K3의 출시 구성은 MXFP4 가중치와 SiTU 활성화를 사용합니다. vLLM은 이제 MXFP4 TRTLLM-Gen 및 DeepGEMM을 통해 SiTU 매개변수를 최적화된 FP4 전문가 경로에 매핑합니다.
하드웨어 지원에는 다음이 포함됩니다:
- NVIDIA: 특정 커널의 최종 튜닝 및 MXFP4 MoE 협력.
- AMD: FlyDSL의 MLIR Python 커널 스택을 통한 초기 지원, 하드웨어 튜닝된 A16W4/A8W4 양자화된 퓨전 연산자 및 SiTU 활성화를 특징으로 합니다.
day-0 릴리스 패키지
오픈소스 릴리스에는 vLLM 모델, 파서, 캐시, 커널 통합이 포함되며, NVIDIA 구성을 위한 초기 Docker 이미지와 검증된 런치 레시피도 함께 제공됩니다. 또한 FlyDSL MoE 커널을 사용하는 초기 AMD 경로, 멀티모달 예시, 툴 사용, 추론, 구조화된 출력 예시, 및 초기 성능 결과도 제공됩니다.