✷ 归档 · 11 个实验室 · 73 篇 dispatch
实验室
不用每天手动刷十几个官方博客。OpenAI、Anthropic、DeepMind 等实验室的一手发布,每篇都提炼出核心内容。
vLLM 通过 PyNvVideoCodec 实现多 GPU 视频字幕生成的扩展
vLLM 现在通过 PyNvVideoCodec 支持 NVIDIA 硬件视频解码,消除了 CPU 瓶颈,并使 H100 GPU 上的多 GPU 视频字幕生成任务吞吐量提升超过两倍。
vLLM Kimi-K3 DSpark 推测解码实现
vLLM 已为 2.8T 参数的 Kimi K3 模型实现了 DSpark 推测器,将数学推理的交互性从 110 提高到 435 tok/s/user,并提供了高达 3.5 倍的输出吞吐量。
vLLM 和 Novita AI 发布 Chord:适用于 Kimi K2.x 的更快 INT4 MoE 内核
Novita AI 开源了 Chord,一个 W4A16 MoE CUDA 操作符,相比公开的 Humming 内核,可将 INT4 量化 Kimi K2.x 的服务速度提升高达 2.15×。
Kimi K3 在 vLLM 中的性能优化
vLLM 已针对 Kimi K3 实现了一系列全栈优化,使得吞吐量提升高达 2.8 倍,并将首字延迟 (TTFT) 降低了高达 85%。
在 AMD Instinct MI355X 上优化 MiniMax M3
vLLM 通过系统化的瓶颈驱动优化过程,在 AMD Instinct MI355X 上为 MiniMax M3 实现了显著的吞吐量提升,在并发度 32 时将 MXFP8 输出 tokens/s/GPU 从 109.1 提升至 342.4。
vLLM 分层 KV 缓存卸载
vLLM 引入了分层 KV 缓存卸载功能,将被驱逐的键值数据保留在主机内存、存储和远程对等节点中,以避免重新计算,降低延迟,并提升服务容量。
vLLM GLM 5.3 优化:混合 HiSparse 卸载
vLLM 为 GLM 5.3 引入了混合 HiSparse 卸载,通过在压力下动态将 KV 缓存卸载到 CPU 内存,实现了单个 8x H200 节点上的完整 100 万上下文长度和更高的并发性。
vLLM AgentX 发布:优化现实世界中的智能体服务
vLLM 发布了一套 KV 缓存、并行化和调度优化,可在 DeepSeek V4 Pro、MiniMax M3 和 Kimi K3 等智能体工作负载上实现高达每 GPU 秒 130K 个 token 的性能,服务成本相比 Opus 5 定价降低 14.6×–106×。
vLLM TT 插件将 Tenstorrent 加速器引入 LLM 服务
vLLM TT 插件通过基于阶段的调度器、设备端采样和进程内车道数据并行,实现了在 Tenstorrent 网格硬件上使用 OpenAI 兼容 API 的 LLM 服务。
vLLM GLM 5.3 优化:Hybrid HiSparse Offloading
vLLM 为 GLM 5.3 引入了 Hybrid HiSparse offloading,使其能够在 8x H200 节点等显存受限的硬件上实现完整的 100 万上下文长度并获得更高的并发量。
MiniMax H3 通过 vLLM-Omni 实现 FastH3 实时推理
vLLM-Omni 集成 FastVideo 的 FastH3 学生模型,可在 8-GPU B300 系统上实现音视频 MP4 的生成速度超过播放速度,达到实时延迟。
vLLM 在 AMD GPU 上的推测解码:性能与方法
vLLM 为 AMD Instinct MI300X/MI355X GPU 添加了推测解码功能,允许轻量级草稿模型提出多个标记,由目标模型在一次前向传播中验证,根据草稿方法、模型家族和提议长度的不同,可使输出标记吞吐量翻倍甚至更高。
vLLM 使用 Ray Direct Transport 实现大规模分片权重传输
vLLM 引入了一个使用 Ray Direct Transport (RDT) 的分片权重传输引擎,旨在为在线 RL 设置中的万亿参数模型实现高效、容错的权重同步。
IsoExec: 切换 SkyRL 中的训练器-推理不匹配
vLLM 推出了 IsoExec,一种统一的执行抽象,通过执行合约和并行不变性内核,消除 RL 工作负载中训练引擎与推理引擎之间的数值不匹配。
VeRL-Omni v0.2.20 发布说明 / 新特性
VeRL-Omni v0.2.0 引入了请求级批处理以实现更快的扩散 RL,并引入了可复用的全模态训练栈以实现稳定的多模态自回归训练。
vLLM-Omni 分布式层级卸载 (Distributed Layerwise Offload)
vLLM-Omni 引入了分布式层级卸载 (DLO),通过权重分片和双缓冲预取技术优化 HBM 和宿主机内存使用,从而实现对超过 200B 参数的大型 Diffusion Transformer (DiT) 模型的有效推理服务。
vLLM 使用 DSpark 进行自适应验证
vLLM 引入了使用 DSpark 置信度头的自适应验证,通过动态调整每步验证的投机标记数量,在不同的并发水平下保持高吞吐量。
vLLM Day 0 Support for Qwen3.8-2.4T-A95B
vLLM 宣布对 Qwen3.8-2.4T-A95B 提供 Day-0 支持,这是一个拥有 2.4 万亿参数的稀疏 MoE 模型,为开放权重版本带来了 Qwen-Max 级的能力。
vLLM 对 NVIDIA Nemotron 3.5 Lightning 的 Day-0 支持
NVIDIA 发布了对 30B Nemotron 3.5 Lightning 模型的 vLLM Day-0 支持,通过混合 MoE 架构和三种投机解码技术,实现了快速、全天候的智能体推理。
vLLM Decode Context Parallelism for Long Context Workloads
vLLM 引入了 Decode Context Parallelism (DCP),通过按序列维度在 GPU 之间分片 KV cache,显著提升了长上下文 agentic 工作负载的并发量和吞吐量。
vLLM Qwen3.5 性能优化
vLLM 通过 Blackwell 优化的 kernel、混合缓存状态传输以及异步调度,在 GB200 NVL72 系统上为 Qwen3.5 实现了超过 25,000 tokens per second (TPS) per GPU 的总吞吐量。
vLLM 对 Arm CPU 的优化
vLLM 已为基于 Arm Neoverse 的服务器实现了一系列全栈优化,通过在内存分配、同步和量化方面的改进,实现了最高 6.2 倍的吞吐提升。
vLLM Speculators: 用于投机解码的并行草拟技术
vLLM 和 Speculators 项目引入了对 P-EAGLE、DFlash 和 DSpark 的开源支持,超越了自回归草拟,通过并行生成候选 token 块来实现更快的 LLM 推理。
vLLM Kimi K3 支持
vLLM 已发布 Kimi K3 的 day-0 支持,Kimi K3 是一个 2.8 万亿参数的多模态 MoE 模型,具备对 Kimi Delta Attention 和 DSpark 投机解码的优化,可实现最高 370 tok/s。
vLLM AFD Plugin:为 MoE 推理实现 Attention 与 FFN 解耦
vLLM AFD Plugin 引入了 Attention-FFN 解耦 (AFD),允许混合专家模型 (MoE) 中的 Attention 和 FFN 路径进行独立扩展和执行,从而优化推理吞吐量和延迟。
使用 vLLM 在 NVIDIA B300 GPU 上部署 GLM-5.2
通过实施 P/D 解耦、投机填充和 IndexerCache 优化,vLLM 在 24 块 NVIDIA B300 GPU 上实现了 GLM-5.2-NVFP4 的生产级 SLA 合规性。
vLLM Kimi K3 支持预览
vLLM 正在为 Moonshot AI 的 Kimi K3 准备 day-0 开源服务支持,这是一个具有 2.8 万亿参数的模型,具有混合 KDA/全注意力架构和原生视觉支持。
超越单一模型:使用 vLLM Semantic Router 构建混合模型 (Mixture-of-Models) 系统
vLLM Semantic Router 现在支持构建、版本化和部署混合模型 (Mixture-of-Models) 系统,该系统通过单一模型接口协调多个独立模型。
vLLM 生产质量:CI、基准测试与发布流程概述
vLLM 利用由持续集成、性能基准测试和严格发布流程组成的三层质量保证框架,在极其多样化的硬件和模型架构中保持稳定性。
vLLM TML Inkling 支持
vLLM 已宣布对 1T 参数多模态模型 TML Inkling 提供 Day-0 支持,通过专门的架构优化,在 4 张 GB200 GPU 上实现了高达 380 tok/s/user 的性能。
vLLM 和 TileRT 集成用于低延迟关键服务
vLLM 已将 TileRT 0.1.5 集成为可插拔的解码引擎,以在保持 vLLM 标准预填充和服务基础设施的同时,为低延迟关键工作负载提供原生的每用户解码速度。
EAGLE-3 在 AMD Instinct GPU 上的推测解码
vLLM 和 AMD Quark 已在 AMD Instinct GPU 上实现了 EAGLE-3 推测解码的端到端管道,使 Kimi-K2.5 的吞吐量提升最高可达 2.00x,MiniMax-M2.5 的吞吐量提升最高可达 1.79x。
vime 对 AMD Instinct GPU 的 ROCm 支持
vLLM 已宣布为 vime 提供 ROCm 支持,使得端到端的强化学习后训练工作流能够在 AMD Instinct MI300X 和 MI355X GPU 上原生运行。
vLLM × HPC-Ops:来自腾讯混元的高性能注意力和 MoE 后端
vLLM 现已集成针对 NVIDIA Hopper H20 优化的 HPC-Ops 注意力和 MoE 后端,实现最高 2.95 倍的注意力加速和 1.59 倍的 MoE 加速,在 Hy3 上将 TTFT 降低约 24%,TPOT 降低约 17%。
vLLM-Omni 为 Qwen3-Omni-30B-A3B-Instruct 推理服务的优化方案
vLLM-Omni 通过 Thinker、Talker 和 Code2Wav 的三阶段流水线提供 Qwen3-Omni-30B-A3B-Instruct 服务,并通过阶段分解、CUDA Graphs、异步分块交接、异步输出、阶段副本和热路径清理提升了吞吐量和延迟。
vLLM Semantic Router: 通过微智能体协作提升模型性能
vLLM 引入了 Semantic Router,这是一个服务层原语,它将单个模型 API 调用转换为微智能体的有限协作,以在复杂基准上超越前沿模型。
vLLM-Omni TTS 推理工程
vLLM-Omni 通过应用解耦延迟和吞吐量瓶颈的模型特定优化,为 Qwen3-TTS、VoxCPM2、Higgs Audio V3 和 Fish Speech S2 Pro 等模型设计了 TTS 推理,显著提升了音频吞吐量并降低了端到端延迟。
vLLM 语义路由器 Fusion 原语实现可编程的多模型服务
vLLM 为其语义路由器引入了 Fusion 原语,使可编程的多模型面板、评判和合成成为一等的服务模式。
MiniMax M3 vLLM 支持:面向 1M Token 多模态推理的 Day-0 部署
vLLM 已发布对 MiniMax M3 系列模型的 Day-0 支持,借助 MiniMax Sparse Attention (MSA) 实现高效的 1M Token 上下文服务和原生多模态推理。
DiffusionGemma: 首个在 vLLM 中获得原生支持的 Diffusion LLM
vLLM 已集成 DiffusionGemma,这是一个 26B 参数的离散扩散语言模型,通过迭代式地对 Token 块进行去噪而非顺序自回归解码,实现了高吞吐量、低延迟的生成。
vime RL 框架发布
vLLM 推出 vime,这是一个开源的 RL 后训练框架,它将 Megatron 训练与 vLLM 推理相结合,以提供一个稳定且高效的 LLM 强化学习管道。
vLLM Semantic Router v0.3 Themis 发布说明
vLLM Semantic Router v0.3 Themis 引入了有状态的生产级路由,其特点是会话感知智能体路由 (SAAR)、规范的配置契约,以及对 AMD ROCm 和 Intel OpenVINO 扩展的硬件支持。
NVIDIA Nemotron 3 Ultra 在 vLLM 上的支持
vLLM 宣布对 NVIDIA Nemotron 3 Ultra 提供 Day-0 支持,这是一个 550B 参数的模型,通过混合 Transformer-Mamba MoE 架构针对长时间运行的自主代理工作流程进行了优化。
vLLM 快速且高效的 LLM 推理课程上线
vLLM 与 DeepLearning.AI 及 Red Hat 合作推出了一门名为 Fast & Efficient LLM Inference with vLLM 的免费中级课程,旨在教授完整的 AI 部署生命周期。
vLLM 会话感知代理路由(SAAR)发布
vLLM 引入了会话感知代理路由(SAAR),这是一种模型选择策略,通过在工具循环和提供者状态转换期间防止不安全的模型切换,以保持会话连续性并降低长时程 LLM 代理的成本。
vLLM-Omni 通过 AutoRound 量化加速推理
vLLM-Omni 现在集成了 Intel 的 AutoRound 训练后量化技术,实现了 W4A16 量化,在保持准确性的同时将模型大小缩减高达 62%,并解锁了在 Intel XPU 和 NVIDIA GPU 上的性能增益。
vLLM 在 DGX Spark 上:架构、配置与本地评估
vLLM 为 NVIDIA DGX Spark 提供高性能的本地推理端点,利用统一内存架构和兼容 OpenAI 的 API,实现了包括 Nemotron-3-Super 在内的大型 NVFP4 模型的部署。
Speculators v0.5.0 发行说明 / 新功能
Speculators v0.5.0 引入了 DFlash 算法支持,用于单次通过草稿令牌生成,通过 vLLM 原生隐藏状态提取统一了在线和离线训练,并提供了更新的文档。
vLLM 语义路由器多模态路由和视觉编码器加固
vLLM 为语义路由器(VSR)引入了多模态路由,使得系统能够将视觉证据作为请求级策略决策的一等信号使用,同时解决了 Rust/Candle 与 PyTorch 路径之间的关键实现漂移。
Laguna XS.2 使用 vLLM、Speculators 和 LLM Compressor 进行推理优化
Poolside 和 Red Hat AI 使用 vLLM 集成、DFlash 推测解码和 LLM Compressor 量化,对 Laguna XS.2 33B-A3B MoE 模型进行了优化,以适用于 agentic 编码任务。