vLLM의 Qwen3.8-2.4T-A95B Day 0 지원
vLLM은 이제 Qwen3.8-2.4T-A95B에 대한 Day-0 지원을 제공하여, 오픈 웨이트(open weights) 기반의 Qwen-Max급 모델 배포를 가능하게 합니다. 이번 릴리스는 Qwen 3.5 아키텍처를 통합하여, 아키텍처 변경 없이도 vLLM에서 즉시 모델을 실행할 수 있도록 합니다.
모델 아키텍처 및 하드웨어 요구 사항
Qwen3.8-2.4T-A95B는 2.4조 개의 파라미터와 512개의 전문가를 가진 희소 Mixture-of-Experts (MoE) 모델입니다. 92개의 레이어로 구성된 하이브리드 백본은 특정 어텐션 메커니즘을 사용합니다. 즉, 매 4번째 레이어마다 full attention이 적용되며, 나머지 69개 레이어는 linear attention을 사용합니다.
추론을 위한 하드웨어 요구 사항은 정밀도에 따라 다릅니다:
- Full Precision/FP8: 최소 두 개의 NVIDIA B300 또는 AMD MI355X 노드가 필요합니다.
- FP4 Quantized: 단일 노드에서 실행 가능합니다.
정밀도 및 양자화 옵션
공식 BF16 및 FP8 체크포인트 외에도, Inferact는 MXFP4 및 NVFP4 양자화 가중치를 출시했습니다. 이러한 FP4 버전은 4비트 활성화를 가능하게 하기 위해 activation calibration과 함께 Round-to-Nearest (RTN) 양자화를 사용하며, 특히 메모리 및 대역폭 오버헤드를 줄이기 위해 routed experts 및 선택된 레이어를 타겟팅합니다.
초기 검증 결과 FP4 양자화는 정확도를 유지하는 것으로 나타났습니다. 예를 들어, GSM8K 벤치마크(strict/flexible)에서 NVFP4 버전은 90.37% / 91.05%를 달성하여, FP8의 89.61% / 90.52%와 비교되었습니다. AIME25 @3 (avg/pass)에서 NVFP4는 FP8의 87.78% / 93.33% 대비 92.22% / 96.67%에 도달했습니다.
하드웨어 특화 최적화
이러한 규모의 모델을 지원하기 위해 vLLM은 NVIDIA 및 AMD와 협력하여 최적화된 커널을 개발했습니다:
NVIDIA 플랫폼
NVIDIA와 Inferact는 Dense GEMMs, MoE routing, Attention (GQA) 및 Linear Attention (Gated Delta Rule)을 위한 초고속 커널을 개발했습니다. 이 구현에는 통신 오버헤드를 최소화하기 위한 새로운 fused kernels와, Attention 및 Expert Parallelism을 위한 Data Parallelism 및 Tensor Parallelism을 결합한 특정 작업 분할이 포함됩니다.
AMD Instinct GPU
데이터 이동 및 커널 실행 오버헤드를 줄이는 AITER-fused Gated DeltaNet decode, attention 및 MoE 커널을 통해 가속화가 이루어집니다. 공유 전문가(shared-expert) 경로는 최적화된 hipBLASLt GEMM 커널을 활용하며, routed experts는 AITER FusedMoE를 사용합니다. 또한, AMD Quark 양자화 지원을 통해 효율적인 MXFP4 배포가 가능합니다.
배포 및 설정
최적의 성능을 위해 Qwen 3.8 모델 카드는 다음과 같은 생성 파라미터를 권장합니다:
- Temperature: 1.0
- Top_p: 0.95
- Top_k: 20
- Min_p: 0.0
- Presence Penalty: 0.0
- Repetition Penalty: 1.0
Qwen 3.8은 추론(reasoning) 모델이므로, 사용자는 에이전트 워크플로우에 충분한 토큰 예산을 제공하기 위해 높은 max_tokens 값(예: 128,000)을 설정할 것을 권장합니다.
빠른 시작 명령
NVFP4 배포:
vllm serve Inferact/Qwen3.8-2.4T-A95B-NVFP4 \
--linear-backend flashinfer_cutedsl \
--tensor-parallel-size 8 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder \
--reasoning-parser qwen3 \
--speculative-config '{"method":"mtp","num_speculative_tokens":3}'
MXFP4 배포:
vllm serve Inferact/Qwen3.8-2.4T-A95B-MXFP4 \
--tensor-parallel-size 8 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder \
--reasoning-parser qwen3 \
--speculative-config '{"method":"mtp","num_speculative_tokens":3}'
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch