✷ 归档 · 11 个实验室 · 73 篇 dispatch
实验室
不用每天手动刷十几个官方博客。OpenAI、Anthropic、DeepMind 等实验室的一手发布,每篇都提炼出核心内容。
vLLM 原生 RL API 发布
vLLM 已引入原生权重同步 API 并改进了异步 RL 支持,以标准化训练和推理之间的权重传输,并在大规模 DPEP 部署中消除死锁。
EAGLE 3.1 发布说明:提升推测解码的鲁棒性和效率
EAGLE 3.1 引入架构改进以解决注意力漂移,在长上下文工作负载中将接受长度翻倍,并通过 vLLM 和 TorchSpec 的集成显著提升吞吐量。
vLLM x Novita AI: 用于生产级外部 KV Cache 的 PegaFlow
vLLM 与 Novita AI 宣布推出 PegaFlow,这是一种外部 KV cache 服务,它将 KV cache 与 vLLM worker 解耦,从而实现更快的启动速度、通过缓存共享实现更高的吞吐量以及基于 RDMA 的跨节点访问。
VeRL-Omni: 用于扩散和全模态模型的强化学习训练框架
vLLM 已宣布 VeRL-Omni 的预发布,这是一个专门为多模态生成模型设计的通用强化学习后训练框架,包括扩散和全模态架构。
vLLM 弹性专家并行
vLLM 引入弹性专家并行(Elastic EP),使得 Mixture-of-Experts (MoE) 部署能够在运行时上下调工作节点数量,而无需服务器重启。
vLLM 性能基准:领跑 Artificial Analysis 排行榜
vLLM 通过实施激进的内核融合和推测解码优化,在 Artificial Analysis 排行榜上为 DeepSeek V3.2、MiniMax-M2.5 和 Qwen 3.5 397B 获得了最高排名。
vLLM TurboQuant 研究:准确性与性能分析
vLLM 的一项综合研究表明,FP8 仍然是 KV-cache 量化的最佳默认选项,而 TurboQuant 各变体则以显著的吞吐量和延迟为代价换取额外的内存容量。
在规模化环境下使用 vLLM x Mooncake 提供 Agentic 工作负载
vLLM 集成了 Mooncake 的分布式 KV 缓存存储,以提升 Agentic 大语言模型服务,在真实追踪上实现了 3.8 倍更高的吞吐量、46 倍更低的首次生成时间(TTFT)以及 8.6 倍更低的端到端延迟,并可扩展至 60 台 GB200 GPU。
NVIDIA Nemotron 3 Nano Omni 在 vLLM 中的支持
vLLM 现在支持 NVIDIA Nemotron 3 Nano Omni,这是一款高效的 30B MoE 多模态模型,将视觉、音频和语言推理统一到单一循环中,为代理式 AI 提供动力。
vLLM DeepSeek V4 支持:高效长上下文注意力
vLLM 现已支持 DeepSeek V4-Pro 和 V4-Flash,实现了一种新注意力机制,使上下文长度可达一百万 token,并显著节省 KV 缓存内存。
vLLM FP8 KV-Cache 和 Attention 量化更新
vLLM 已优化 FP8 KV-cache 和 attention 量化,在 Hopper 和 Blackwell 架构上降低了解码延迟和内存占用,同时保持了接近基准的准确性。
vLLM v0.20.0 为混合 SSM 模型添加了分离式服务
vLLM v0.20.0 引入了针对混合 SSM‑FA 模型的分离式预填充/解码服务,通过双描述符视图和三描述符卷积状态传输实现高效的 KV 传输。
vLLM 韩国 Meetup 2026 总结
2026 年在首尔举办的 vLLM 韩国 Meetup 突出展示了 vLLM 向统一推理基础设施的演进,呈现了社区增长、硬件集成进展、生产栈特性以及在开源和企业轨道中的真实部署策略。
vLLM Prefill-Decode 解耦与 MORI-IO
vLLM 在单节点 8-GPU MI300X 环境中使用 AMD 的 MORI-IO 连接器实现 Prefill-Decode 解耦,通过消除跨标记延迟峰值,实现了 2.5 倍更高的有效吞吐量。
Gemma 4 在 vLLM 上:高级推理和多模态能力
vLLM 引入了对 Gemma 4 的 Day 0 支持,Gemma 4 是谷歌推出的一系列开放模型,具备高级推理、多模态输入,并在 TPU、GPU 和 XPU 等硬件上具有广泛兼容性。
vLLM 隐状态提取系统
vLLM v0.18.0 引入了原生的隐藏状态提取系统,使得能够高性能地获取内部模型表示,以用于训练投机解码的草稿模型。
vLLM Model Runner V2 发布说明 / 新功能
vLLM 推出了 Model Runner V2(MRV2),这是一项从头重新实现的模型运行器,通过 GPU 原生、异步优先和模块化的架构提升吞吐量并降低延迟。
P-EAGLE:vLLM 中的并行投机解码
vLLM 引入了 P-EAGLE,这是一种并行投机解码方法,可在一次前向传播中生成所有草稿标记,在 NVIDIA B200 GPU 上相较于原生 EAGLE-3 实现最高 1.69 倍的加速。
vLLM 对 NVIDIA Nemotron 3 Super 的支持
vLLM 现在支持 NVIDIA Nemotron 3 Super,这是一款拥有 1200 亿参数的混合 MoE 模型,针对多代理 AI 进行了优化,具备 100 万 token 的上下文窗口和高推理效率。
vLLM Semantic Router v0.2 Athena 发布说明 / 新功能
vLLM Semantic Router v0.2 Athena 引入了全新构建的模型堆栈、实验性的 ClawOS 编排层以及先进的模型选择原语,将语义路由转变为面向多代理部署的战略系统大脑。
vLLM Triton 注意力后端深度解析
vLLM 实现了一个可移植的基于 Triton 的注意力后端,使用单一源码实现,在 NVIDIA、AMD 和 Intel GPU 上达到了业界领先的性能。
vLLM AMD ROCm 注意力后端优化
vLLM 为 AMD ROCm 引入了优化的注意力后端,在 Instinct MI300X、MI325X 和 MI355X GPU 上实现了 MHA 吞吐量提升最高 4.4 倍、MLA 吞吐量提升最高 1.5 倍。
vLLM 多 LoRA 服务用于 MoE 模型
vLLM 0.15.0 版引入了针对混合专家(MoE)模型的优化多 LoRA 服务,使多个微调适配器能够共享单个 GPU,从而降低空闲计算容量。