vLLM TML Inkling 지원

vLLM TML Inkling 지원

vLLM은 Thinking Machines Lab에서 개발한 1T-파라미터 멀티모달 모델인 TML Inkling에 대한 Day-0 지원을 이제 제공합니다. 이 통합은 thinkingmachines/Inkling-NVFP4thinkingmachines/Inkling (BF16) 버전에 대해 고성능 추론을 가능하게 하며, 텍스트, 이미지, 오디오 입력을 지원하고 네이티브 컨텍스트 길이는 최대 1백만 토큰까지입니다.

성능 및 하드웨어 벤치마크

4개의 NVIDIA GB200 GPU 구성에서 vLLM은 Multi-Token Prediction (MTP)를 사용할 때 사용자당 최대 380 tok/s, MTP를 사용하지 않을 때 사용자당 최대 140 tok/s의 처리량을 달성합니다. 이러한 결과는 SPEED-Bench에서 8K 입력 토큰 프롬프트와 요청당 1K 출력 토큰을 사용하여 측정되었습니다.

현재 지원은 NVIDIA Blackwell 및 Hopper GPU에 최적화되어 있지만, vLLM은 AMD GPU를 포함한 기타 하드웨어로 지원을 확장하기 위해 적극적으로 작업 중이며, 이는 모델의 상대 주의 메커니즘을 위한 전용 커널이 현재 필요합니다.

TML Inkling 모델 아키텍처

TML Inkling은 1T 파라미터를 갖춘 네이티브 멀티모달 디코더 전용 Transformer입니다. 그 아키텍처에는 몇 가지 독특한 구성 요소가 포함됩니다:

  • 멀티모달 입력: 모델은 텍스트, 이미지(경량 hMLP 인코더를 통해), 오디오(dMel 임베딩을 통해)를 받아들입니다.
  • 하이브리드 주의: 백본은 66개의 레이어로 구성되며, 1M 컨텍스트 길이에서 효율성을 유지하기 위해 11개의 전체 주의 레이어와 55개의 슬라이딩 윈도우 주의 레이어로 이루어집니다. 모든 레이어는 헤드 크기가 128인 그룹드 쿼리 주의(GQA)를 사용합니다.
  • 상대 주의: 로터리 위치 임베딩(RoPE)을 대신하여, Inkling은 사전 소프트맥스 주의 로짓에 추가되는 학습된 상대 위치 항을 사용합니다.
  • 짧은 컨볼루션 (Sconv): 각 레이어는 주의 키, 주의 값, 주의 출력, MoE 출력에 적용된 4개의 sconv 모듈(윈도우 크기 4)을 사용하여 최소한의 오버헤드로 로컬 주의를 제공합니다.
  • 전문가 혼합 (MoE): 각 레이어는 256개의 라우팅된 전문가(상위 6)와 2개의 공유 전문가로 구성됩니다. Inkling은 '전문가 싱크'를 도입하는데, 여기서 두 개의 공유 전문가는 확률 질량을 흡수하기 위해 라우팅 점수 계산에 참여하지만 상위 6 선택에서는 제외됩니다.
  • 추측 디코딩 (MTP): 모델은 단일 레이어 Transformer인 8개의 연결된 MTP 헤드를 포함하여 순방향 단계당 최대 9개의 토큰 생성을 허용합니다.

In the Inkling-NVFP4 variant, only the routed experts are quantized to NVFP4, while shared experts and qkvr linears remain in BF16.

vLLM 기술적 최적화

Sconv 캐시 및 TP 샤딩

짧은 컨볼루션 (sconv) 캐시를 관리하기 위해, vLLM은 이를 가상 슬라이딩 윈도우 주의 레이어의 KV 캐시로 취급하여 통합 KV 캐시 관리자에 통합합니다.

GPU 간 sconv 계산 및 캐시 중복을 피하기 위해, vLLM은 Sconv-aware TP 샤딩을 사용합니다. 출력 프로젝션 후 표준 all-reduce 대신, vLLM은 채널 차원에서 reduce-scatter와 all-gather를 사용합니다.これにより 각 GPU는 자체 채널 슬라이드만 저장하고 계산하며, 이는 채널 차원에 적용된 시퀀스 병렬 처리와 유사합니다.

저지연 컬렉티브 및 커널

  • 퓨즈드 컬렉티브: vLLM은 Lamport 프로토콜(데이터 값 폴링)을 기반으로 한 저지연 reduce-scatter 및 all-gather 커널을 사용하며, 배치 크기 1에서의 커널 시간을 40 µs에서 8 µs로 줄입니다.
  • FA4 커널: 상대 주의 메모리 접근 패턴을 최적화하기 위해, vLLM은 'sheared-bias' 기법을 가진 새로운 FA4 커널을 통합합니다. vLLM은 배치 크기, TP 크기, KV 길이를 기반으로 num_splits 요인을 동적으로 선택합니다.
  • MTP KV 캐시 관리: MTP 헤드가 이전 초안 토큰에 의존하기 때문에, vLLM은 기본 모델의 숨은 상태를 캐시하고 거부 샘플링을 따르는 허용된 토큰으로 MTP 헤드를 재실행합니다.

정확성 및 검증

vLLM의 구현은 여러 벤치마크에서 참조 구현과 일치합니다:

  • 멀티모달 및 추론: MMAU(오디오), MMMU-Pro(비전), BFCL(툴 호출), HLE(추론)를 통해 검증되었습니다.
  • 긴 컨텍스트: NIAH를 사용하여 검증되었습니다. vLLM은 221K 토큰까지 참조와 정확히 일치하며, 513K 토큰까지 약 1百分点(pp) 이내로 유지됩니다. 극단적인 길이(800K+)에서는 실행 간 변동이 더 크게 관찰되었습니다.

미래 로드맵

vLLM은 TML Inkling에 다음과 같은 향상 기능을 계획하고 있습니다:

  • FP8 글로벌 주의: FA4 커널 수정을 통해 글로벌 주의에 FP8을 탐색하여 컴퓨팅 및 KV 캐시 병목 현상을 줄입니다.
  • CUDA 그래프: 이미지 및 오디오 인코더에 CUDA 그래프를 적용하여 프리필期间的 CPU 오버헤드를 제거합니다.
  • AMD 지원: AMD GPU 호환성을 가능하게 하기 위해 필요한 상대 주의 커널을 개발합니다.

Sources