Hugging Face 네이티브 속도 vLLM Transformers 모델링 백엔드

Hugging Face 네이티브 속도 vLLM Transformers 모델링 백엔드

TL;DR

Hugging Face는 vLLM용 transformers 모델링 백엔드를 강화하여, 많은 LLM 아키텍처에 대해 네이티브 수준의 손으로 작성된 vLLM 구현을 능가하거나 동등한 처리량을 달성하도록 만들었습니다. 이를 통해 모델 작성자는 기존 transformers 구현을 활용해 맞춤형 최적화 코드를 작성하지 않고도 초고속 vLLM 추론을 얻을 수 있습니다.

성능 벤치마크

transformers 모델링 백엔드는 세 가지 Qwen3 모델 구성에 대해 네이티브 vLLM 구현과 비교 테스트되었습니다. 모든 경우에서 transformers 백엔드는 네이티브 처리량을 만족하거나 능가했습니다:

  • Qwen3-4B (Dense): 단일 GPU에서 테스트되었습니다.
  • Qwen3-32B (Dense): 텐서 병렬성을 사용하여 테스트되었습니다.
  • Qwen3-235B-A22B-FP8 (MoE): 데이터 및 전문가 병렬성을 사용하여 8×H100 노드에서 테스트되었습니다.

이 백엔드를 사용하려면, 사용자는 서빙 시 --model-impl transformers 플래그를 적용하면 됩니다. 이 구현은 --tensor-parallel-size, --data-parallel-size, --enable-expert-parallel 등 표준 병렬 옵션과 호환됩니다.

제한 사항

현재 선형 어텐션을 사용하는 모델은 지원되지 않습니다. 또한 Hub 저장소에 호스팅된 맞춤형 모델이 규정에 맞게 작성되지 않은 경우 작동하지 않을 수 있습니다.

기술 구현: 동적 레이어 융합

이전에는 transformers vLLM 백엔드가 주로 어텐션을 주요 추론 병목 현상으로 집중했습니다. 이는 모델이 효율적으로 실행되도록 했지만, 최대 성능을 달성하려면 GPU 병렬화, 컴파일 및 융합 커널을 처리하기 위한 맞춤형 포트가 여전히 필요했습니다.

업데이트된 백엔드는 이제 호환 가능한 아키텍처에 대해 런타임에 추론 전용 레이어 융합을 동적으로 적용합니다. 이를 통해 모델 작성자가 모델을 두 번 통합할 필요가 없어집니다—transformers용 한 번, vLLM용 한 번.

그래프 분석 및 소스 조작

시스템은 두 단계 최적화 과정을 통해 네이티브 속도를 달성합니다:

  1. 정적 분석: 백엔드는 torch.fx를 사용하여 모델 그래프에 대한 정적 분석을 수행하고 최적화 가능한 알려진 패턴을 식별합니다.
  2. 소스 재작성: 패턴이 식별되면, 백엔드는 추상 구문 트리(AST)를 사용해 소스 코드를 조작하고 연산을 제자리에서 재작성합니다.

주요 최적화

이 과정은 여러 고성능 기능을 가능하게 합니다:

  • Fused Operations: 연산을 최적화된 vLLM 커널에 다대일 매핑하는 것으로, 특히 Mixture-of-Experts (MoE) 모델에서 Expert Parallelization (EP)에 사용됩니다.
  • Parallel Planning: MergedColumnParallelLinearQKVParallelLinear 블록을 사용하면 시스템이 Tensor Parallelism (TP)용 병렬 계획을 추론할 수 있습니다. 디코더 블록 목록을 식별할 수 있는 경우 Pipeline Parallelism (PP) 계획도 추론할 수 있습니다.
  • Compilation Compatibility: 조작된 모델은 torch.compile 및 CUDA Graphs와 완전히 호환되며, 전용 vLLM 구현의 성능 경로를 그대로 반영합니다.
  • Unified Codebase: 최적화가 런타임에 이루어지기 때문에 동일한 transformers 모델 구현을 훈련, 평가, RL 롤아웃 및 고속 추론에 모두 사용할 수 있습니다.

SUMMARY: Hugging Face는 런타임에 추론 전용 레이어 융합을 동적으로 적용함으로써, 맞춤형 vLLM 구현의 처리량에 맞추거나 능가하도록 transformers vLLM 백엔드를 업데이트했습니다.

TITLE: Hugging Face 네이티브 속도 vLLM Transformers 모델링 백엔드

Sources