51

vLLM AMD ROCm 注意力后端优化

vLLM 为 AMD ROCm 引入了优化的注意力后端,在 Instinct MI300X、MI325X 和 MI355X GPU 上实现了 MHA 吞吐量提升最高 4.4 倍、MLA 吞吐量提升最高 1.5 倍。

52

vLLM 多 LoRA 服务用于 MoE 模型

vLLM 0.15.0 版引入了针对混合专家(MoE)模型的优化多 LoRA 服务,使多个微调适配器能够共享单个 GPU,从而降低空闲计算容量。