51

vLLM AMD ROCm 注意力後端最佳化

vLLM 為 AMD ROCm 引入了最佳化的注意力後端,在 Instinct MI300X、MI325X 與 MI355X GPU 上,為 MHA 模型提供最高 4.4 倍的吞吐量提升,為 MLA 模型提供最高 1.5 倍的提升。

52

vLLM 多 LoRA 服務於 MoE 模型

vLLM 0.15.0 版引入了針對混合專家(MoE)模型的優化多 LoRA 服務,讓多個微調適配器能共享單一 GPU,以降低閒置計算資源。