vLLM Kimi-K3 DSpark 사전 해석 구현

개요

vLLM는 Kimi K3(2.8T 파라미터)라는 전면 모델에 대해 DSpark 사전 해석기(Draft Model)를 성공적으로 훈련하고 배포했습니다. Speculators 훈련 라이브러리와 GB300 NVL72 하드웨어를 활용하여, 수학적 추론 워크로드에서 단일 스트림 상호작용성을 약 110에서 435 tok/s/user로 증가시키고, 동시 부하 하에서 최대 3.5배 높은 출력 처리량을 제공합니다.

DSpark 알고리즘

DSpark는 병렬 예측 블록에서 하나의 실수가 나머지 토큰을 무효화하는 '접미사 감쇠(suffix decay)' 문제를 해결하기 위해 설계된 DFlash 블록 수준 사전 해석 알고리즘의 확장입니다. DSpark는 DFlash의 병렬 기반 구조를 유지하면서, 토큰 간 일관성을 향상시키기 위해 두 가지 특정 구성 요소를 도입합니다:

  • 마르코프 로짓-바이어스 헤드: 이 구성 요소는 토큰을 순차적으로 샘플링하고, 이전에 선택된 토큰을 기반으로 낮은 랭크 전이 행렬을 사용하여 로짓을 조정하여, 추가적인 트랜스포머 단계 없이도 국소적 의존성을 복원합니다.
  • 신뢰도 헤드: 이 헤드는 토큰 수용 확률을 추정하여, 하드웨어 인식 스케줄러가 저부하 시 더 긴 접두사 검증과 고부하 시 불확실한 접미사 자르기를 가능하게 합니다.

DFlash에 비해 DSpark는 Qwen3 타겟 모델에서 16–18% 더 긴 수용된 시퀀스를 보고하며, EAGLE-3보다 27–31% 더 긴 시퀀스를 제공합니다.

추론 성능 및 기능

Kimi K3 DSpark 사전 해석기는 각 추론 단계에서 8개의 토큰을 제안하는 다섯 계층, 50억 파라미터의 드래프트 모델을 사용합니다.

벤치마크 및 처리량

9개의 평가 영역에서 모델은 검증 라운드당 평균 4.11개의 토큰을 수용했습니다. 구조화된 작업에서 성능이 가장 높았습니다:

  • 수학적 추론: 6.42개 토큰
  • HumanEval: 4.96개 토큰
  • 번역: 4.65개 토큰

장문 컨텍스트 성능

LongBench-v2 데이터셋에서, 378K 토큰 프롬프트 상황에서 사전 해석기는 한 번의 디코딩 반복당 최대 5.31개의 출력 토큰을 달성했습니다. 상위 10% 요청은 반복당 최소 3.76개의 토큰을 유지하여, 극한의 컨텍스트 길이에서도 사전 해석이 효과적임을 보여줍니다.

동시성 및 지연 시간

동시성은 1에서 16으로 증가하면서, 집계 출력 처리량은 초당 177에서 683으로 증가했습니다. 중앙값 첫 번째 토큰 시간(TTFT)은 안정적으로 유지되었으며, 동시 요청이 16배 증가했음에도 불구하고 단지 100밀리초(379ms에서 479ms) 증가했습니다.

하드웨어 및 훈련 인프라

GB300 NVL72 구성

훈련은 Ubuntu 24.04.4 LTS와 NVIDIA의 64K 페이지 커널 6.14를 사용한 GB300 랙에서 수행되었습니다. 환경은 NVIDIA의 610.57.04 오픈 커널 GPU 드라이버(R610)와 CUDA 13.4.0 개발자 미리보기 버전을 사용했으며, 이는 Rubin 지원(sm_107)을 포함한 최초의 툴킷입니다.

Mooncake 숨겨진 상태 전달

드래프트 모델은 예측을 일치시키기 위해 타겟 모델의 숨겨진 상태를 종종 필요로 하므로, vLLM은 MooncakeHiddenStatesConnector를 구현했습니다. 이 시스템은 분리된 훈련과 숨겨진 상태 추출을 가능하게 하며, Kimi K3(2.8T 파라미터)와 같은 크기의 모델이 4비트 양자화를 사용해도 단일 노드 구성의 VRAM 한계를 초과하므로 필수적입니다.

  • 메커니즘: 마스터 Mooncake 프록시 프로세스가 vLLM과 훈련 인스턴스 간 통신을 관리합니다. 훈련 프로세스는 vLLM 프론트엔드를 통해 숨겨진 상태를 요청하고, Mooncake 저장소 키를 수신하며, Mooncake 마스터가 RDMA 또는 TCP를 사용하여 전달을 중개합니다.
  • 탑오로지: Kimi K3에 최적화된 구성은 세 개의 노드로 이루어진 세트로, 두 개는 vLLM 추론에 전용되고, 하나는 훈련에 전용됩니다.

배포

Kimi K3 DSpark 사전 해석기는 Hugging Face(RedHatAI/Kimi-K3-speculator.dspark)를 통해 이용 가능하며, 다음 사전 해석 구성과 함께 vLLM을 사용하여 배포할 수 있습니다:

{
  "model": "RedHatAI/Kimi-K3-speculator.dspark",
  "num_speculative_tokens": 8,
  "method": "dspark",
  "draft_sample_method": "probabilistic",
  "rejection_sample_method": "block"
}

Sources