vLLM 성능 벤치마크: Artificial Analysis 리더보드 1위

vLLM 성능 벤치마크: Artificial Analysis 리더보드 1위

vLLM은 DeepSeek V3.2, MiniMax-M2.5, 그리고 Qwen 3.5 397B에 대해 공격적인 커널 융합 및 추측 디코딩 최적화를 구현함으로써 Artificial Analysis 리더보드에서 최고 순위를 달성했습니다.

vLLM 성능 벤치마크: Artificial Analysis 리더보드 1위

vLLM은 Artificial Analysis 리더보드에서 최고 수준의 성능을 달성했으며, 오픈소스 추론 엔진이 NVIDIA Blackwell Ultra 실리콘에서 독점 스택보다 뛰어날 수 있음을 보여줍니다. 주요 성과로는 DeepSeek V3.2에 대해 사용자당 출력 처리량 230 TPS를 기록했으며, 10,000 토큰 프롬프트에 대해 첫 토큰 도달 시간(TTFT)이 1초 미만인 Qwen 3.5 397B가 1위를 차지했습니다.

DeepSeek V3.2: 커널 실행 오버헤드 감소

DeepSeek V3.2의 성능은 원시 연산보다 낮은 배치 크기에서 GPU 커널 실행 오버헤드에 의해 주로 제한되었습니다. vLLM은 어텐션 경로 전반에 걸쳐 공격적인 연산 융합을 구현하여 레이어당 약 33개의 커널 실행을 약 10개로 축소함으로써 이를 해결했습니다. 이 융합은 Q와 KV 정규화, Q와 KV에 대한 로터리 임베딩, 인덱서의 레이어 정규화와 로터리 임베딩, FP8 양자화, 그리고 KV 캐시 쓰기를 포함합니다.

성능 향상:

  • Fusion Impact: 배치 크기 1에서 1.28배 속도 향상을 달성했습니다(4× GB200에서 MTP 없이 85.8에서 109.3 tok/s로 증가).
  • Throughput Scaling: 동시성 1인 단일 8× B300 노드에서, MTP 없이 125 tok/s, MTP=1일 때 234 tok/s(~90% 초안 수용), 그리고 prefill/decode 분리(TP=4 + TP=4 + MTP=3) 시 262 tok/s에 도달했습니다.
  • Router GEMM Kernel: 작은 디코드 배치 크기에서 MoE 라우팅 차원을 위한 특수 커널이 배치 1에서 추가 6% 속도 향상을 제공했습니다 (PR #34302).
  • TopK Kernel: 희소 어텐션 인덱서를 위한 새로운 커널이 128K 컨텍스트 디코드에서 토큰당 지연을 최대 17% 개선했습니다 (PR #37421).

이러한 최적화는 이제 vLLM의 DeepSeek V4 지원의 기반이 됩니다.

MiniMax-M2.5: 추측 디코딩 및 맞춤형 융합

MiniMax-M2.5의 경우, vLLM은 목표 커널 융합을 맞춤형 EAGLE3 초안 모델과 결합했습니다. 초안 모델은 TorchSpec을 사용해 훈련되었으며, 이는 torch 기반 온라인 추측 디코딩 프레임워크로, 실시간 vLLM이 생성한 hidden state를 활용해 기본 모델의 정확한 토큰 분포와 일치하도록 합니다.

기술 향상:

  • Speculative Infrastructure: MRV2 경로에 대한 개선 사항으로는 후반 위치에서 수용률을 높이기 위한 초안 모델 메타데이터 수정(PR #38311)과 초안 prefill에 대한 CUDA 그래프 지원(PR #37588)이 포함되었습니다.
  • QK-Norm Fusion: 비표준 어텐션 정규화를 처리하기 위해 맞춤형 fuse_minimax_qk_norm 커널을 구현했으며, 여기서는 텐서-병렬 랭크 전반에 걸쳐 Q와 K 분산을 감소시킨 후 채널당 스케일링을 수행합니다 (PR #37045).
  • Ceiling Performance: 융합과 완벽한 초안 모델(수용률 100%)을 사용했을 때, 스택은 동시성 1에서 326 tok/s에 도달했습니다 (TP=4, EAGLE3 + 3 추측 토큰).

Qwen 3.5 397B: 선형 어텐션 최적화

Qwen 3.5 397B는 선형 어텐션과 비표준 정규화 변형을 사용하며, 초기에는 vLLM의 표준 allreduce_rms 융합을 우회하여 디코드 시간의 약 절반이 융합되지 않은 디바이스 간 감소 연산에 사용되었습니다.

최적화 모음:

  • Normalization Fix: allreduce_rms 융합 패스를 업데이트하여 Qwen의 특정 정규화 변형을 인식하도록 함으로써 배치 크기 1 초과에서 약 5% TPOT 향상을 달성했습니다.
  • Post-Conv Fusion: 선형 어텐션 아키텍처에 특화된 사후 투영 컨볼루션 경로에 대한 커널 융합을 구현했습니다 (PR #37813).
  • Execution Efficiency: qk-norm + rope 경로와 이중 스트림 실행을 위한 커널 수준 최적화를 통합하여 독립적인 연산 분기를 겹치게 했습니다.

프로덕션 결과:

  • Concurrency 1: 163 tok/s에 도달했습니다 (TEP=8, post-conv fusion).
  • Concurrency 256: 7.33 req/s에 도달했으며, 이는 6.69 req/s 기준 대비 10% 증가한 수치입니다.

오픈소스 추론에 대한 시사점

위에서 상세히 설명한 모든 최적화—DeepSeek V3.2 어텐션 경로 융합, MiniMax EAGLE3 레시피, 그리고 Qwen 3.5 융합—는 이미 vLLM 메인 브랜치에 병합되었거나 현재 진행 중입니다. 이는 이러한 벤치마크에서 얻은 성능 향상이 오픈소스 엔진 사용자 모두에게 제공되어, 최고 추론 성능에 독점 소프트웨어 스택이 필요하다는 가정을 뒤흔듭니다.

Sources