01

vLLM 在 Arm CPU 上的最佳化

vLLM 為基於 Arm Neoverse 的伺服器實施了一系列全堆疊最佳化,透過記憶體配置、同步與量化的改進,達到最高 6.2 倍的吞吐量提升。

02

vLLM Speculators: 用於推測解碼的並行草擬

vLLM 與 Speculators 專案推出開源支援,支援 P-EAGLE、DFlash 和 DSpark,超越自回歸草擬,以並行方式生成候選詞元區塊,以實現更快的 LLM 推論。

03

vLLM Kimi K3 支援

vLLM 已發布對 Kimi K3 的 day-0 支援,這是一個擁有 2.8 兆參數的多模態 MoE 模型,具備針對 Kimi Delta Attention 和 DSpark 投機解碼的優化,可實現高達 370 tok/s 的速度。

04

vLLM AFD Plugin:針對 MoE 推論實現 Attention 與 FFN 解耦

vLLM AFD Plugin 引入了 Attention-FFN 解耦 (AFD) 技術,允許混合專家模型 (MoE) 中的 Attention 與 FFN 路徑進行獨立擴展與執行,以優化服務吞吐量與延遲。

05

在 NVIDIA B300 GPU 上使用 vLLM 服務 GLM-5.2

vLLM 透過實作 P/D 分離、投機填充和 IndexerCache 優化,在 24 顆 NVIDIA B300 GPU 上達成 GLM-5.2-NVFP4 的生產 SLA 合規。

06

vLLM Kimi K3 支援預覽

vLLM 正在為 Moonshot AI 的 Kimi K3(一個具有混合 KDA/完整注意力架構和原生視覺支援的 2.8 兆參數模型)準備 day-0 開源服務支援。

07

超越單一模型:使用 vLLM Semantic Router 構建 Mixture-of-Models 系統

vLLM Semantic Router 現在支援構建、版本化與部署 Mixture-of-Models 系統,透過單一模型介面協調多個獨立模型。

08

vLLM 生產品質:CI、基準測試與發佈流程概述

vLLM 利用包含持續整合、效能基準測試和嚴格發佈流程在內的三層品質保證框架,在極其多樣的硬體和模型架構中維持穩定性。

09

vLLM TML Inkling 支援

vLLM 已宣佈對 TML Inkling 提供 Day-0 支援,這是一個 1T 參數多模態模型,透過專門的架構優化,在 4 顆 GB200 GPU 上可達到最高 380 tok/s/user。

10

vLLM 和 TileRT 整合以實現延遲關鍵服務

vLLM 已將 TileRT 0.1.5 作為可插拔的解碼引擎進行整合,以提供原生的每個用戶解碼速度給延遲關鍵工作負載,同時保持 vLLM 標準的預填充和服務基礎設施。

11

EAGLE-3 投機解碼於 AMD Instinct GPU

vLLM 和 AMD Quark 已在 AMD Instinct GPU 上實現 EAGLE-3 投機解碼的端到端管線,對 Kimi-K2.5 達成最高 2.00x 的吞吐量提升,對 MiniMax-M2.5 達成最高 1.79x 的吞吐量提升。

12

vime ROCm 對 AMD Instinct GPUs 的支援

vLLM 已宣布為 vime 提供 ROCm 支援,使得端到端的強化學習後訓練工作流程能夠在 AMD Instinct MI300X 和 MI355X GPU 上原生運行。

13

vLLM × HPC-Ops:來自騰訊混元的高性能 Attention 與 MoE 後端

vLLM 現在已納入針對 NVIDIA Hopper H20 優化的 HPC-Ops Attention 與 MoE 後端,在 Hy3 上可提供高達 2.95× 的 Attention 加速與 1.59× 的 MoE 加速,並減少約 24% 的 TTFT 與 17% 的 TPOT。

14

vLLM-Omni 為 Qwen3-Omni-30B-A3B-Instruct 推論服務進行的優化

vLLM-Omni 透過三階段流水線(Thinker、Talker、Code2Wav)提供 Qwen3-Omni-30B-A3B-Instruct 服務,並利用階段分解、CUDA Graphs、非同步分塊傳遞、非同步輸出、階段副本及熱路徑清理來提升吞吐量與降低延遲。

15

vLLM Semantic Router:透過微代理協作提升模型性能

vLLM 推出了 Semantic Router,這是一種服務層原語,將單次模型 API 調用轉化為微代理的受限協作,從而在複雜的基準測試中超越前沿模型。

16

vLLM-Omni TTS 推理工程

vLLM-Omni 為 Qwen3-TTS、VoxCPM2、Higgs Audio V3 和 Fish Speech S2 Pro 等模型進行了 TTS 推理工程,透過應用針對特定模型的優化來解耦延遲與吞吐量瓶頸,顯著提升了音訊吞吐量並降低了端到端延遲。

17

vLLM 語意路由器 Fusion 原語實現可程式化的多模型服務

vLLM 為其語意路由器引入了 Fusion 原語,使可程式化的多模型面板、評判與合成成為一等的服務模式。

18

MiniMax M3 vLLM 支援:面向 1M 令牌多模態推理的 Day-0 服務

vLLM 已發布對 MiniMax M3 模型系列的 day-0 支援,使得能夠使用 MiniMax 稀疏注意力 (MSA) 高效服務 1M 令牌上下文與原生多模態推理。

19

DiffusionGemma: 首個原生支援於 vLLM 的擴散 LLM

vLLM 已整合 DiffusionGemma,這是一個 26B 參數離散擴散語言模型,透過迭代去噪 token 區塊而非序列自回歸解碼,實現高吞吐量、低延遲的生成。

20

vime RL Framework 發布

vLLM 推出 vime,一個開源的 RL 後訓練框架,整合 Megatron 訓練與 vLLM 推理,以提供穩定且高效的管線用於 LLM 強化學習。

21

vLLM Semantic Router v0.3 Themis 發佈說明

vLLM Semantic Router v0.3 Themis 引入了狀態化生產級路由,具備會話感知代理路由 (SAAR)、規範的配置規範,以及對 AMD ROCm 和 Intel OpenVINO 擴展的硬體支援。

22

NVIDIA Nemotron 3 Ultra 支援於 vLLM

vLLM 宣布對 NVIDIA Nemotron 3 Ultra 提供 Day-0 支援,這是一個 550B 參數模型,透過混合 Transformer-Mamba MoE 架構,針對長時間運行的自主代理工作流程進行優化。

23

Fast & Efficient LLM Inference with vLLM 課程發布

vLLM 與 DeepLearning.AI 和 Red Hat 合作,推出了一個免費的中級課程,名為 Fast & Efficient LLM Inference with vLLM,旨在教授完整的 AI 部署生命週期。

24

vLLM Session-Aware Agentic Routing (SAAR) 發布

vLLM 推出 Session-Aware Agentic Routing (SAAR),這是一種模型選擇政策,透過在工具循環和提供者狀態過程中防止不安全的模型切換,來保持會話連續性並降低長時程 LLM 代理的成本。

25

vLLM-Omni 透過 AutoRound 量化加速推理

vLLM-Omni 現在整合了 Intel 的 AutoRound 訓練後量化技術,實現了 W4A16 量化,在保持準確度的同時,可減少高達 62% 的模型大小,並在 Intel XPU 和 NVIDIA GPU 上釋放性能增益。

26

vLLM 在 DGX Spark 上:架構、設定與本地評估

vLLM 為 NVIDIA DGX Spark 提供高效能的本地推論端點,透過統一記憶體架構與相容 OpenAI 的 API,使得部署大型 NVFP4 模型(如 Nemotron-3-Super)成為可能。

27

使用 vLLM、Speculators 與 LLM Compressor 進行 Laguna XS.2 推論優化

Poolside 與 Red Hat AI 透過 vLLM 整合、DFlash 投機解碼與 LLM Compressor 量化,針對代理編碼任務優化了 Laguna XS.2 33B-A3B MoE 模型。

28

vLLM Semantic Router 多模態路由與視覺編碼器強化

vLLM 已在 Semantic Router (VSR) 中引入了多模態路由,使系統能夠將視覺證據作為請求層級策略決策的一等公民信號,同時解決了 Rust/Candle 與 PyTorch 路徑之間關鍵的實作漂移問題。

29

Speculators v0.5.0 發行說明 / 新功能

Speculators v0.5.0 引入 DFlash 演算法支援,用於單通過草稿 token 生成,透過 vLLM 原生隱藏狀態提取統一線上與離線訓練,並更新文件。

30

vLLM 原生 RL API 發布

vLLM 已引入原生權重同步 API 並改進異步 RL 支援,以標準化訓練與推理之間的權重傳輸,並消除大規模 DPEP 部署中的死鎖。

31

EAGLE 3.1 版本說明:提升推測解碼的韌性與效率

EAGLE 3.1 引入架構改進以解決注意力漂移,在長上下文工作負載中將可接受長度提升至兩倍,並透過 vLLM 與 TorchSpec 整合顯著提升吞吐量。

32

vLLM x Novita AI: PegaFlow 用於生產級外部 KV Cache

vLLM 與 Novita AI 宣布推出 PegaFlow,這是一個外部 KV cache 服務,它將 KV cache 與 vLLM worker 解耦,實現了更快的啟動速度、透過快取共享獲得更高的吞吐量,以及基於 RDMA 的跨節點存取。

33

VeRL-Omni: 擴散和全模態模型的強化學習訓練框架

vLLM 已宣布 VeRL-Omni 的預發布版本,這是一個專門為多模態生成模型(包括擴散和全模態架構)設計的通用強化學習後訓練框架。

34

vLLM 彈性專家並行 (Elastic Expert Parallelism)

vLLM 引入了彈性專家並行 (Elastic EP),使混合專家模型 (MoE) 部署能夠在運行時擴展或縮減工作節點數量,而無需重新啟動伺服器。

35

vLLM 效能基準:領先人工分析排行榜

vLLM 透過實施積極的核心融合與推測解碼優化,在人工分析排行榜上於 DeepSeek V3.2、MiniMax-M2.5 與 Qwen 3.5 397B 獲得最高排名。

36

vLLM TurboQuant 研究:準確性與效能分析

vLLM 的一項全面研究顯示,FP8 仍是 KV 快取量化的最佳預設選擇,而 TurboQuant 變體則以顯著的吞吐量與延遲為代價換取額外的記憶體容量。

37

使用 vLLM x Mooncake 大規模服務 Agentic 工作負載

vLLM 整合 Mooncake 的分散式 KV 快取存儲,以提升 Agentic LLM 服務,在真實追蹤上提供 3.8× 更高的吞吐量、46× 降低的 TTFT 與 8.6× 降低的端到端延遲,同時擴展至 60 個 GB200 GPU。

38

vLLM 中對 NVIDIA Nemotron 3 Nano Omni 的支援

vLLM 現已支援 NVIDIA Nemotron 3 Nano Omni,這是一款高效的 30 億參數 MoE 多模態模型,能在單一迴圈中統合視覺、音訊與語言推理,以驅動代理式 AI。

39

vLLM DeepSeek V4 支援:高效長上下文注意力

vLLM 現已支援 DeepSeek V4-Pro 與 V4-Flash,實作了一種新注意力機制,使上下文長度可達一百萬個 token,並大幅節省 KV cache 記憶體。

40

vLLM FP8 KV-Cache 與 Attention 量化更新

vLLM 已優化 FP8 KV-cache 與 attention 量化,在 Hopper 與 Blackwell 架構上降低了解碼延遲與記憶體使用量,同時保持接近基準的準確度。

41

vLLM v0.20.0 為混合 SSM 模型新增分散式服務

vLLM v0.20.0 為混合 SSM-FA 模型引入分散式 prefill/decode 服務,透過雙描述子視圖與三描述子卷積狀態傳輸,實現高效的 KV 傳輸。

42

vLLM Korea Meetup 2026 總結

vLLM Korea Meetup 2026 在首爾凸顯 vLLM 發展為統一的推理基礎設施,展示社區成長、硬體整合進展、生產堆疊功能,以及跨開源與企業軌道的真實部署策略。

43

vLLM Prefill-Decode 分散式架構與 MORI-IO

vLLM 在單節點 8 GPU MI300X 設備上使用 AMD 的 MORI-IO 連接器實現 Prefill-Decode 分散式架構,藉由消除 Inter-Token Latency 峰值,使效能提升 2.5 倍的 goodput。

44

Gemma 4 在 vLLM 上:先進推理與多模態能力

vLLM 為 Gemma 4 引入 Day 0 支援,這是一個來自 Google 的開放模型系列,具備先進推理、多模態輸入,且在 TPU、GPU 與 XPU 等多種硬體上皆具廣泛相容性。

45

vLLM 隱藏狀態提取系統

vLLM v0.18.0 引入了原生的隱藏狀態提取系統,使得在訓練投機解碼草稿模型時能高效取得模型內部表示。

46

vLLM Model Runner V2 版本說明 / 新功能

vLLM 推出了 Model Runner V2(MRV2),這是一個從頭重新實作的模型執行器,透過 GPU 原生、async‑first 與模組化的架構提升吞吐量並降低延遲。

47

P-EAGLE:vLLM 中的平行推測解碼

vLLM 引入了 P-EAGLE,一種平行推測解碼方法,能在單次前向傳播中生成所有草稿 token,於 NVIDIA B200 GPU 上相較於原始 EAGLE-3 提供最高 1.69 倍的加速。

48

vLLM 中的 NVIDIA Nemotron 3 Super 支援

vLLM 現已支援 NVIDIA Nemotron 3 Super,這是一個擁有 1200 億參數的混合 MoE 模型,針對多代理 AI 進行優化,具備 100 萬 token 的上下文窗口以及高效的推理效能。

49

vLLM Semantic Router v0.2 Athena 發行說明 / 新功能

vLLM Semantic Router v0.2 Athena 引入了全新重建的模型堆疊、實驗性的 ClawOS 協調層,以及先進的模型選擇原語,將語意路由轉變為多代理部署的策略性系統大腦。

50

vLLM Triton 注意力後端深度探討

vLLM 已實作一個可移植的基於 Triton 的注意力後端,透過單一源碼實作,在 NVIDIA、AMD 與 Intel GPU 上達到最先進的效能。