vLLM AMD ROCm アテンションバックエンド最適化
vLLM は AMD ROCm 向けに最適化されたアテンションバックエンドを導入し、Instinct MI300X、MI325X、MI355X GPU 上で MHA のスループットを最大 4.4 倍、MLA モデルを最大 1.5 倍向上させます。
vLLM の MoE モデル向け Multi-LoRA サービング
vLLM バージョン 0.15.0 は、Mixture of Experts(MoE)モデル向けに最適化された Multi-LoRA サービングを導入し、複数のファインチューニングされたアダプタが単一の GPU を共有できるようにして、アイドル状態の計算リソースを削減します。