vLLM 对 Arm CPU 的优化
vLLM 已为基于 Arm Neoverse 的服务器实现了一系列全栈优化,通过在内存分配、同步和量化方面的改进,实现了最高 6.2 倍的吞吐提升。
vLLM Speculators: 用于投机解码的并行草拟技术
vLLM 和 Speculators 项目引入了对 P-EAGLE、DFlash 和 DSpark 的开源支持,超越了自回归草拟,通过并行生成候选 token 块来实现更快的 LLM 推理。
vLLM Kimi K3 支持
vLLM 已发布 Kimi K3 的 day-0 支持,Kimi K3 是一个 2.8 万亿参数的多模态 MoE 模型,具备对 Kimi Delta Attention 和 DSpark 投机解码的优化,可实现最高 370 tok/s。
vLLM AFD Plugin:为 MoE 推理实现 Attention 与 FFN 解耦
vLLM AFD Plugin 引入了 Attention-FFN 解耦 (AFD),允许混合专家模型 (MoE) 中的 Attention 和 FFN 路径进行独立扩展和执行,从而优化推理吞吐量和延迟。
使用 vLLM 在 NVIDIA B300 GPU 上部署 GLM-5.2
通过实施 P/D 解耦、投机填充和 IndexerCache 优化,vLLM 在 24 块 NVIDIA B300 GPU 上实现了 GLM-5.2-NVFP4 的生产级 SLA 合规性。
vLLM Kimi K3 支持预览
vLLM 正在为 Moonshot AI 的 Kimi K3 准备 day-0 开源服务支持,这是一个具有 2.8 万亿参数的模型,具有混合 KDA/全注意力架构和原生视觉支持。
超越单一模型:使用 vLLM Semantic Router 构建混合模型 (Mixture-of-Models) 系统
vLLM Semantic Router 现在支持构建、版本化和部署混合模型 (Mixture-of-Models) 系统,该系统通过单一模型接口协调多个独立模型。
vLLM 生产质量:CI、基准测试与发布流程概述
vLLM 利用由持续集成、性能基准测试和严格发布流程组成的三层质量保证框架,在极其多样化的硬件和模型架构中保持稳定性。
vLLM TML Inkling 支持
vLLM 已宣布对 1T 参数多模态模型 TML Inkling 提供 Day-0 支持,通过专门的架构优化,在 4 张 GB200 GPU 上实现了高达 380 tok/s/user 的性能。
vLLM 和 TileRT 集成用于低延迟关键服务
vLLM 已将 TileRT 0.1.5 集成为可插拔的解码引擎,以在保持 vLLM 标准预填充和服务基础设施的同时,为低延迟关键工作负载提供原生的每用户解码速度。
EAGLE-3 在 AMD Instinct GPU 上的推测解码
vLLM 和 AMD Quark 已在 AMD Instinct GPU 上实现了 EAGLE-3 推测解码的端到端管道,使 Kimi-K2.5 的吞吐量提升最高可达 2.00x,MiniMax-M2.5 的吞吐量提升最高可达 1.79x。
vime 对 AMD Instinct GPU 的 ROCm 支持
vLLM 已宣布为 vime 提供 ROCm 支持,使得端到端的强化学习后训练工作流能够在 AMD Instinct MI300X 和 MI355X GPU 上原生运行。
vLLM × HPC-Ops:来自腾讯混元的高性能注意力和 MoE 后端
vLLM 现已集成针对 NVIDIA Hopper H20 优化的 HPC-Ops 注意力和 MoE 后端,实现最高 2.95 倍的注意力加速和 1.59 倍的 MoE 加速,在 Hy3 上将 TTFT 降低约 24%,TPOT 降低约 17%。
vLLM-Omni 为 Qwen3-Omni-30B-A3B-Instruct 推理服务的优化方案
vLLM-Omni 通过 Thinker、Talker 和 Code2Wav 的三阶段流水线提供 Qwen3-Omni-30B-A3B-Instruct 服务,并通过阶段分解、CUDA Graphs、异步分块交接、异步输出、阶段副本和热路径清理提升了吞吐量和延迟。
vLLM Semantic Router: 通过微智能体协作提升模型性能
vLLM 引入了 Semantic Router,这是一个服务层原语,它将单个模型 API 调用转换为微智能体的有限协作,以在复杂基准上超越前沿模型。
vLLM-Omni TTS 推理工程
vLLM-Omni 通过应用解耦延迟和吞吐量瓶颈的模型特定优化,为 Qwen3-TTS、VoxCPM2、Higgs Audio V3 和 Fish Speech S2 Pro 等模型设计了 TTS 推理,显著提升了音频吞吐量并降低了端到端延迟。
vLLM 语义路由器 Fusion 原语实现可编程的多模型服务
vLLM 为其语义路由器引入了 Fusion 原语,使可编程的多模型面板、评判和合成成为一等的服务模式。
MiniMax M3 vLLM 支持:面向 1M Token 多模态推理的 Day-0 部署
vLLM 已发布对 MiniMax M3 系列模型的 Day-0 支持,借助 MiniMax Sparse Attention (MSA) 实现高效的 1M Token 上下文服务和原生多模态推理。
DiffusionGemma: 首个在 vLLM 中获得原生支持的 Diffusion LLM
vLLM 已集成 DiffusionGemma,这是一个 26B 参数的离散扩散语言模型,通过迭代式地对 Token 块进行去噪而非顺序自回归解码,实现了高吞吐量、低延迟的生成。
vime RL 框架发布
vLLM 推出 vime,这是一个开源的 RL 后训练框架,它将 Megatron 训练与 vLLM 推理相结合,以提供一个稳定且高效的 LLM 强化学习管道。
vLLM Semantic Router v0.3 Themis 发布说明
vLLM Semantic Router v0.3 Themis 引入了有状态的生产级路由,其特点是会话感知智能体路由 (SAAR)、规范的配置契约,以及对 AMD ROCm 和 Intel OpenVINO 扩展的硬件支持。
NVIDIA Nemotron 3 Ultra 在 vLLM 上的支持
vLLM 宣布对 NVIDIA Nemotron 3 Ultra 提供 Day-0 支持,这是一个 550B 参数的模型,通过混合 Transformer-Mamba MoE 架构针对长时间运行的自主代理工作流程进行了优化。
vLLM 快速且高效的 LLM 推理课程上线
vLLM 与 DeepLearning.AI 及 Red Hat 合作推出了一门名为 Fast & Efficient LLM Inference with vLLM 的免费中级课程,旨在教授完整的 AI 部署生命周期。
vLLM 会话感知代理路由(SAAR)发布
vLLM 引入了会话感知代理路由(SAAR),这是一种模型选择策略,通过在工具循环和提供者状态转换期间防止不安全的模型切换,以保持会话连续性并降低长时程 LLM 代理的成本。
vLLM-Omni 通过 AutoRound 量化加速推理
vLLM-Omni 现在集成了 Intel 的 AutoRound 训练后量化技术,实现了 W4A16 量化,在保持准确性的同时将模型大小缩减高达 62%,并解锁了在 Intel XPU 和 NVIDIA GPU 上的性能增益。
vLLM 在 DGX Spark 上:架构、配置与本地评估
vLLM 为 NVIDIA DGX Spark 提供高性能的本地推理端点,利用统一内存架构和兼容 OpenAI 的 API,实现了包括 Nemotron-3-Super 在内的大型 NVFP4 模型的部署。
Laguna XS.2 使用 vLLM、Speculators 和 LLM Compressor 进行推理优化
Poolside 和 Red Hat AI 使用 vLLM 集成、DFlash 推测解码和 LLM Compressor 量化,对 Laguna XS.2 33B-A3B MoE 模型进行了优化,以适用于 agentic 编码任务。
vLLM 语义路由器多模态路由和视觉编码器加固
vLLM 为语义路由器(VSR)引入了多模态路由,使得系统能够将视觉证据作为请求级策略决策的一等信号使用,同时解决了 Rust/Candle 与 PyTorch 路径之间的关键实现漂移。
Speculators v0.5.0 发行说明 / 新功能
Speculators v0.5.0 引入了 DFlash 算法支持,用于单次通过草稿令牌生成,通过 vLLM 原生隐藏状态提取统一了在线和离线训练,并提供了更新的文档。
vLLM 原生 RL API 发布
vLLM 已引入原生权重同步 API 并改进了异步 RL 支持,以标准化训练和推理之间的权重传输,并在大规模 DPEP 部署中消除死锁。
EAGLE 3.1 发布说明:提升推测解码的鲁棒性和效率
EAGLE 3.1 引入架构改进以解决注意力漂移,在长上下文工作负载中将接受长度翻倍,并通过 vLLM 和 TorchSpec 的集成显著提升吞吐量。
vLLM x Novita AI: 用于生产级外部 KV Cache 的 PegaFlow
vLLM 与 Novita AI 宣布推出 PegaFlow,这是一种外部 KV cache 服务,它将 KV cache 与 vLLM worker 解耦,从而实现更快的启动速度、通过缓存共享实现更高的吞吐量以及基于 RDMA 的跨节点访问。
VeRL-Omni: 用于扩散和全模态模型的强化学习训练框架
vLLM 已宣布 VeRL-Omni 的预发布,这是一个专门为多模态生成模型设计的通用强化学习后训练框架,包括扩散和全模态架构。
vLLM 弹性专家并行
vLLM 引入弹性专家并行(Elastic EP),使得 Mixture-of-Experts (MoE) 部署能够在运行时上下调工作节点数量,而无需服务器重启。
vLLM 性能基准:领跑 Artificial Analysis 排行榜
vLLM 通过实施激进的内核融合和推测解码优化,在 Artificial Analysis 排行榜上为 DeepSeek V3.2、MiniMax-M2.5 和 Qwen 3.5 397B 获得了最高排名。
vLLM TurboQuant 研究:准确性与性能分析
vLLM 的一项综合研究表明,FP8 仍然是 KV-cache 量化的最佳默认选项,而 TurboQuant 各变体则以显著的吞吐量和延迟为代价换取额外的内存容量。
在规模化环境下使用 vLLM x Mooncake 提供 Agentic 工作负载
vLLM 集成了 Mooncake 的分布式 KV 缓存存储,以提升 Agentic 大语言模型服务,在真实追踪上实现了 3.8 倍更高的吞吐量、46 倍更低的首次生成时间(TTFT)以及 8.6 倍更低的端到端延迟,并可扩展至 60 台 GB200 GPU。
NVIDIA Nemotron 3 Nano Omni 在 vLLM 中的支持
vLLM 现在支持 NVIDIA Nemotron 3 Nano Omni,这是一款高效的 30B MoE 多模态模型,将视觉、音频和语言推理统一到单一循环中,为代理式 AI 提供动力。
vLLM DeepSeek V4 支持:高效长上下文注意力
vLLM 现已支持 DeepSeek V4-Pro 和 V4-Flash,实现了一种新注意力机制,使上下文长度可达一百万 token,并显著节省 KV 缓存内存。
vLLM FP8 KV-Cache 和 Attention 量化更新
vLLM 已优化 FP8 KV-cache 和 attention 量化,在 Hopper 和 Blackwell 架构上降低了解码延迟和内存占用,同时保持了接近基准的准确性。
vLLM v0.20.0 为混合 SSM 模型添加了分离式服务
vLLM v0.20.0 引入了针对混合 SSM‑FA 模型的分离式预填充/解码服务,通过双描述符视图和三描述符卷积状态传输实现高效的 KV 传输。
vLLM 韩国 Meetup 2026 总结
2026 年在首尔举办的 vLLM 韩国 Meetup 突出展示了 vLLM 向统一推理基础设施的演进,呈现了社区增长、硬件集成进展、生产栈特性以及在开源和企业轨道中的真实部署策略。
vLLM Prefill-Decode 解耦与 MORI-IO
vLLM 在单节点 8-GPU MI300X 环境中使用 AMD 的 MORI-IO 连接器实现 Prefill-Decode 解耦,通过消除跨标记延迟峰值,实现了 2.5 倍更高的有效吞吐量。
Gemma 4 在 vLLM 上:高级推理和多模态能力
vLLM 引入了对 Gemma 4 的 Day 0 支持,Gemma 4 是谷歌推出的一系列开放模型,具备高级推理、多模态输入,并在 TPU、GPU 和 XPU 等硬件上具有广泛兼容性。
vLLM 隐状态提取系统
vLLM v0.18.0 引入了原生的隐藏状态提取系统,使得能够高性能地获取内部模型表示,以用于训练投机解码的草稿模型。
vLLM Model Runner V2 发布说明 / 新功能
vLLM 推出了 Model Runner V2(MRV2),这是一项从头重新实现的模型运行器,通过 GPU 原生、异步优先和模块化的架构提升吞吐量并降低延迟。
P-EAGLE:vLLM 中的并行投机解码
vLLM 引入了 P-EAGLE,这是一种并行投机解码方法,可在一次前向传播中生成所有草稿标记,在 NVIDIA B200 GPU 上相较于原生 EAGLE-3 实现最高 1.69 倍的加速。
vLLM 对 NVIDIA Nemotron 3 Super 的支持
vLLM 现在支持 NVIDIA Nemotron 3 Super,这是一款拥有 1200 亿参数的混合 MoE 模型,针对多代理 AI 进行了优化,具备 100 万 token 的上下文窗口和高推理效率。
vLLM Semantic Router v0.2 Athena 发布说明 / 新功能
vLLM Semantic Router v0.2 Athena 引入了全新构建的模型堆栈、实验性的 ClawOS 编排层以及先进的模型选择原语,将语义路由转变为面向多代理部署的战略系统大脑。
vLLM Triton 注意力后端深度解析
vLLM 实现了一个可移植的基于 Triton 的注意力后端,使用单一源码实现,在 NVIDIA、AMD 和 Intel GPU 上达到了业界领先的性能。