vLLM의 Qwen3.8-2.4T-A95B Day 0 지원

vLLM은 이제 Qwen3.8-2.4T-A95B에 대한 Day-0 지원을 제공하여, 오픈 웨이트(open weights) 기반의 Qwen-Max급 모델 배포를 가능하게 합니다. 이번 릴리스는 Qwen 3.5 아키텍처를 통합하여, 아키텍처 변경 없이도 vLLM에서 즉시 모델을 실행할 수 있도록 합니다.

모델 아키텍처 및 하드웨어 요구 사항

Qwen3.8-2.4T-A95B는 2.4조 개의 파라미터와 512개의 전문가를 가진 희소 Mixture-of-Experts (MoE) 모델입니다. 92개의 레이어로 구성된 하이브리드 백본은 특정 어텐션 메커니즘을 사용합니다. 즉, 매 4번째 레이어마다 full attention이 적용되며, 나머지 69개 레이어는 linear attention을 사용합니다.

추론을 위한 하드웨어 요구 사항은 정밀도에 따라 다릅니다:

  • Full Precision/FP8: 최소 두 개의 NVIDIA B300 또는 AMD MI355X 노드가 필요합니다.
  • FP4 Quantized: 단일 노드에서 실행 가능합니다.

정밀도 및 양자화 옵션

공식 BF16 및 FP8 체크포인트 외에도, Inferact는 MXFP4 및 NVFP4 양자화 가중치를 출시했습니다. 이러한 FP4 버전은 4비트 활성화를 가능하게 하기 위해 activation calibration과 함께 Round-to-Nearest (RTN) 양자화를 사용하며, 특히 메모리 및 대역폭 오버헤드를 줄이기 위해 routed experts 및 선택된 레이어를 타겟팅합니다.

초기 검증 결과 FP4 양자화는 정확도를 유지하는 것으로 나타났습니다. 예를 들어, GSM8K 벤치마크(strict/flexible)에서 NVFP4 버전은 90.37% / 91.05%를 달성하여, FP8의 89.61% / 90.52%와 비교되었습니다. AIME25 @3 (avg/pass)에서 NVFP4는 FP8의 87.78% / 93.33% 대비 92.22% / 96.67%에 도달했습니다.

하드웨어 특화 최적화

이러한 규모의 모델을 지원하기 위해 vLLM은 NVIDIA 및 AMD와 협력하여 최적화된 커널을 개발했습니다:

NVIDIA 플랫폼

NVIDIA와 Inferact는 Dense GEMMs, MoE routing, Attention (GQA) 및 Linear Attention (Gated Delta Rule)을 위한 초고속 커널을 개발했습니다. 이 구현에는 통신 오버헤드를 최소화하기 위한 새로운 fused kernels와, Attention 및 Expert Parallelism을 위한 Data Parallelism 및 Tensor Parallelism을 결합한 특정 작업 분할이 포함됩니다.

AMD Instinct GPU

데이터 이동 및 커널 실행 오버헤드를 줄이는 AITER-fused Gated DeltaNet decode, attention 및 MoE 커널을 통해 가속화가 이루어집니다. 공유 전문가(shared-expert) 경로는 최적화된 hipBLASLt GEMM 커널을 활용하며, routed experts는 AITER FusedMoE를 사용합니다. 또한, AMD Quark 양자화 지원을 통해 효율적인 MXFP4 배포가 가능합니다.

배포 및 설정

최적의 성능을 위해 Qwen 3.8 모델 카드는 다음과 같은 생성 파라미터를 권장합니다:

  • Temperature: 1.0
  • Top_p: 0.95
  • Top_k: 20
  • Min_p: 0.0
  • Presence Penalty: 0.0
  • Repetition Penalty: 1.0

Qwen 3.8은 추론(reasoning) 모델이므로, 사용자는 에이전트 워크플로우에 충분한 토큰 예산을 제공하기 위해 높은 max_tokens 값(예: 128,000)을 설정할 것을 권장합니다.

빠른 시작 명령

NVFP4 배포:

vllm serve Inferact/Qwen3.8-2.4T-A95B-NVFP4 \
  --linear-backend flashinfer_cutedsl \
  --tensor-parallel-size 8 \
  --enable-auto-tool-choice \
  --tool-call-parser qwen3_coder \
  --reasoning-parser qwen3 \
  --speculative-config '{"method":"mtp","num_speculative_tokens":3}'

MXFP4 배포:

vllm serve Inferact/Qwen3.8-2.4T-A95B-MXFP4 \
  --tensor-parallel-size 8 \
  --enable-auto-tool-choice \
  --tool-call-parser qwen3_coder \
  --reasoning-parser qwen3 \
  --speculative-config '{"method":"mtp","num_speculative_tokens":3}'

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch