vLLM AMD ROCm 어텐션 백엔드 최적화
vLLM은 AMD ROCm용 최적화된 어텐션 백엔드를 도입하여 Instinct MI300X, MI325X, MI355X GPU에서 MHA는 최대 4.4배, MLA는 1.5배 높은 처리량을 제공합니다.
vLLM MoE 모델을 위한 Multi-LoRA 서빙
vLLM 버전 0.15.0은 Mixture of Experts (MoE) 모델을 위한 최적화된 Multi-LoRA 서빙을 도입하여, 여러 파인튜닝 어댑터가 단일 GPU를 공유함으로써 유휴 컴퓨팅 용량을 줄일 수 있게 합니다.