✷ 封存 · 11 個實驗室 · 73 篇 dispatch
實驗室
不用每天手動刷十幾個官方部落格。OpenAI、Anthropic、DeepMind 等實驗室的一手發布,每篇都提煉出核心內容。
vLLM 使用 PyNvVideoCodec 在多 GPU 上擴展影片字幕生成
vLLM 現在支援透過 PyNvVideoCodec 使用 NVIDIA 硬體影片解碼,移除了 CPU 瓶頸,並在 H100 GPU 上使多 GPU 影片字幕生成任務的吞吐量超過兩倍。
vLLM Kimi-K3 DSpark 推測解碼實作
vLLM 已為 2.8T 參數的 Kimi K3 模型實作了 DSpark 推測器,將數學推理的互動性從 110 提升至 435 tok/s/user,並提供高達 3.5 倍的輸出吞吐量。
vLLM 與 Novita AI 發布 Chord:針對 Kimi K2.x 的更快 INT4 MoE 核心
Novita AI 將 Chord 開源,這是一個 W4A16 MoE CUDA 操作器,可使 INT4 量化 Kimi K2.x 服務速度比公開的 Humming 核心快達 2.15×。
Kimi K3 在 vLLM 中的效能優化
vLLM 已針對 Kimi K3 實施了一系列全堆疊優化,實現了高達 2.8 倍的吞吐量提升,以及高達 85% 的首字延遲 (TTFT) 降低。
在 AMD Instinct MI355X 上優化 MiniMax M3
vLLM 在 AMD Instinct MI355X 上對 MiniMax M3 實現顯著的吞吐量提升,透過系統性的瓶頸驅動優化流程,將併發 32 時的 MXFP8 輸出 token/s/GPU 從 109.1 提升至 342.4。
vLLM 分層 KV 快取卸載
vLLM 引入了分層 KV 快取卸載功能,可將被驅逐的鍵值資料儲存在主機記憶體、儲存空間與遠端對等節點中,避免重新計算,降低延遲,並提升服務容量。
vLLM GLM 5.3 優化:混合 HiSparse 離線處理
vLLM 為 GLM 5.3 引入混合 HiSparse 離線處理,透過在壓力下動態將 KV 快取離線至 CPU 記憶體,使單一 8x H200 節點上實現完整的 100 萬上下文長度與更高的併發性。
vLLM AgentX 發布:優化現實世界中的代理服務
vLLM 發布了一套 KV 快取、平行處理與排程優化,可在 DeepSeek V4 Pro、MiniMax M3 與 Kimi K3 等代理工作負載上實現每 GPU 秒最高 130K token 的效能,並帶來 14.6×–106× 的成本優勢。
vLLM TT 插件將 Tenstorrent 加速器帶入 LLM 服務
vLLM TT 插件透過階段式排程、設備端取樣與程序內 lane 資料平行,實現在 Tenstorrent 網格硬體上的 OpenAI 兼容 LLM 服務。
vLLM GLM 5.3 優化:Hybrid HiSparse Offloading
vLLM 為 GLM 5.3 引入了 Hybrid HiSparse offloading,使其在 8x H200 節點等記憶體受限的硬體上,能夠實現完整的 100 萬上下文長度並提高並行度。
MiniMax H3 FastH3 使用 vLLM-Omni 實時服務
vLLM-Omni 整合 FastVideo 的 FastH3 學生模型,以比播放速度更快的速度生成完整的 MiniMax H3 影音 MP4,於 8 GPU 的 B300 系統上實現實時延遲。
vLLM 在 AMD GPU 上的預測性解碼:效能與方法
vLLM 將預測性解碼引入 AMD Instinct MI300X/MI355X GPU,讓輕量級草稿模型提出多個 token,由目標模型在單一傳播中驗證,根據草稿方法、模型家族與提案長度的不同,輸出 token 吞吐量可提升一倍以上。
vLLM 使用 Ray Direct Transport 進行大規模分片權重傳輸
vLLM 推出了一款使用 Ray Direct Transport (RDT) 的分片權重傳輸引擎,旨在為線上 RL 設定中的兆參數模型提供高效、具容錯能力的權重同步。
IsoExec: Eliminating Trainer-Inference Mismatch in SkyRL
vLLM 推出了 IsoExec,這是一種統一的執行抽象,透過執行合約與並行性無關的內核,消除了 RL 工作負載中訓練與推理引擎之間的數值不匹配問題。
VeRL-Omni v0.2.0 發佈說明 / 更新內容
VeRL-Omni v0.2.0 引入了請求級批處理以加速擴散 RL,並提供了一個可重複使用的全模態訓練堆疊,用於穩定的多模態自回歸訓練。
vLLM-Omni 分布式層次化卸載 (Distributed Layerwise Offload)
vLLM-Omni 引入了分布式層次化卸載 (DLO),通過優化權重分片和雙緩衝預取技術,優化了 HBM 和宿主記憶體的使用,從而實現了對超過 200B 參數的大型 Diffusion Transformer (DiT) 模型的有效服務。
vLLM 使用 DSpark 進行自適應驗證
vLLM 引入了使用 DSpark 置信度頭的自適應驗證,透過動態調整每一步驗證的投機標記數量,在不同的併發層級下維持高吞吐量。
vLLM 對 Qwen3.8-2.4T-A95B 的 Day 0 支援
vLLM 已宣布對 Qwen3.8-2.4T-A95B 提供 Day-0 支援,這是一個擁有 2.4 兆參數的稀疏 MoE 模型,為開源權重釋出帶來了 Qwen-Max 級別的能力。
NVIDIA Nemotron 3.5 Lightning 在 vLLM 上的首日支援
NVIDIA 發布了針對 30B Nemotron 3.5 Lightning 模型的 vLLM 首日支援,透過混合 MoE 架構與三種投機解碼技術,實現快速且全天候的代理程式推理。
vLLM 針對長文本工作負載的解碼上下文並行 (Decode Context Parallelism) 技術
vLLM 引入了解碼上下文並行 (DCP),透過沿著序列維度在 GPU 之間切分 KV cache,顯著提升了長文本 agentic 工作負載的併發量與吞吐量。
vLLM Qwen3.5 效能優化
vLLM 在 GB200 NVL72 系統上透過 Blackwell 優化的 kernel、混合快取狀態傳輸以及非同步排程,為 Qwen3.5 實現了每 GPU 超過 25,000 tokens per second (TPS) 的總吞吐量。
vLLM 在 Arm CPU 上的最佳化
vLLM 為基於 Arm Neoverse 的伺服器實施了一系列全堆疊最佳化,透過記憶體配置、同步與量化的改進,達到最高 6.2 倍的吞吐量提升。
vLLM Speculators: 用於推測解碼的並行草擬
vLLM 與 Speculators 專案推出開源支援,支援 P-EAGLE、DFlash 和 DSpark,超越自回歸草擬,以並行方式生成候選詞元區塊,以實現更快的 LLM 推論。
vLLM Kimi K3 支援
vLLM 已發布對 Kimi K3 的 day-0 支援,這是一個擁有 2.8 兆參數的多模態 MoE 模型,具備針對 Kimi Delta Attention 和 DSpark 投機解碼的優化,可實現高達 370 tok/s 的速度。
vLLM AFD Plugin:針對 MoE 推論實現 Attention 與 FFN 解耦
vLLM AFD Plugin 引入了 Attention-FFN 解耦 (AFD) 技術,允許混合專家模型 (MoE) 中的 Attention 與 FFN 路徑進行獨立擴展與執行,以優化服務吞吐量與延遲。
在 NVIDIA B300 GPU 上使用 vLLM 服務 GLM-5.2
vLLM 透過實作 P/D 分離、投機填充和 IndexerCache 優化,在 24 顆 NVIDIA B300 GPU 上達成 GLM-5.2-NVFP4 的生產 SLA 合規。
vLLM Kimi K3 支援預覽
vLLM 正在為 Moonshot AI 的 Kimi K3(一個具有混合 KDA/完整注意力架構和原生視覺支援的 2.8 兆參數模型)準備 day-0 開源服務支援。
超越單一模型:使用 vLLM Semantic Router 構建 Mixture-of-Models 系統
vLLM Semantic Router 現在支援構建、版本化與部署 Mixture-of-Models 系統,透過單一模型介面協調多個獨立模型。
vLLM 生產品質:CI、基準測試與發佈流程概述
vLLM 利用包含持續整合、效能基準測試和嚴格發佈流程在內的三層品質保證框架,在極其多樣的硬體和模型架構中維持穩定性。
vLLM TML Inkling 支援
vLLM 已宣佈對 TML Inkling 提供 Day-0 支援,這是一個 1T 參數多模態模型,透過專門的架構優化,在 4 顆 GB200 GPU 上可達到最高 380 tok/s/user。
vLLM 和 TileRT 整合以實現延遲關鍵服務
vLLM 已將 TileRT 0.1.5 作為可插拔的解碼引擎進行整合,以提供原生的每個用戶解碼速度給延遲關鍵工作負載,同時保持 vLLM 標準的預填充和服務基礎設施。
EAGLE-3 投機解碼於 AMD Instinct GPU
vLLM 和 AMD Quark 已在 AMD Instinct GPU 上實現 EAGLE-3 投機解碼的端到端管線,對 Kimi-K2.5 達成最高 2.00x 的吞吐量提升,對 MiniMax-M2.5 達成最高 1.79x 的吞吐量提升。
vime ROCm 對 AMD Instinct GPUs 的支援
vLLM 已宣布為 vime 提供 ROCm 支援,使得端到端的強化學習後訓練工作流程能夠在 AMD Instinct MI300X 和 MI355X GPU 上原生運行。
vLLM × HPC-Ops:來自騰訊混元的高性能 Attention 與 MoE 後端
vLLM 現在已納入針對 NVIDIA Hopper H20 優化的 HPC-Ops Attention 與 MoE 後端,在 Hy3 上可提供高達 2.95× 的 Attention 加速與 1.59× 的 MoE 加速,並減少約 24% 的 TTFT 與 17% 的 TPOT。
vLLM-Omni 為 Qwen3-Omni-30B-A3B-Instruct 推論服務進行的優化
vLLM-Omni 透過三階段流水線(Thinker、Talker、Code2Wav)提供 Qwen3-Omni-30B-A3B-Instruct 服務,並利用階段分解、CUDA Graphs、非同步分塊傳遞、非同步輸出、階段副本及熱路徑清理來提升吞吐量與降低延遲。
vLLM Semantic Router:透過微代理協作提升模型性能
vLLM 推出了 Semantic Router,這是一種服務層原語,將單次模型 API 調用轉化為微代理的受限協作,從而在複雜的基準測試中超越前沿模型。
vLLM-Omni TTS 推理工程
vLLM-Omni 為 Qwen3-TTS、VoxCPM2、Higgs Audio V3 和 Fish Speech S2 Pro 等模型進行了 TTS 推理工程,透過應用針對特定模型的優化來解耦延遲與吞吐量瓶頸,顯著提升了音訊吞吐量並降低了端到端延遲。
vLLM 語意路由器 Fusion 原語實現可程式化的多模型服務
vLLM 為其語意路由器引入了 Fusion 原語,使可程式化的多模型面板、評判與合成成為一等的服務模式。
MiniMax M3 vLLM 支援:面向 1M 令牌多模態推理的 Day-0 服務
vLLM 已發布對 MiniMax M3 模型系列的 day-0 支援,使得能夠使用 MiniMax 稀疏注意力 (MSA) 高效服務 1M 令牌上下文與原生多模態推理。
DiffusionGemma: 首個原生支援於 vLLM 的擴散 LLM
vLLM 已整合 DiffusionGemma,這是一個 26B 參數離散擴散語言模型,透過迭代去噪 token 區塊而非序列自回歸解碼,實現高吞吐量、低延遲的生成。
vime RL Framework 發布
vLLM 推出 vime,一個開源的 RL 後訓練框架,整合 Megatron 訓練與 vLLM 推理,以提供穩定且高效的管線用於 LLM 強化學習。
vLLM Semantic Router v0.3 Themis 發佈說明
vLLM Semantic Router v0.3 Themis 引入了狀態化生產級路由,具備會話感知代理路由 (SAAR)、規範的配置規範,以及對 AMD ROCm 和 Intel OpenVINO 擴展的硬體支援。
NVIDIA Nemotron 3 Ultra 支援於 vLLM
vLLM 宣布對 NVIDIA Nemotron 3 Ultra 提供 Day-0 支援,這是一個 550B 參數模型,透過混合 Transformer-Mamba MoE 架構,針對長時間運行的自主代理工作流程進行優化。
Fast & Efficient LLM Inference with vLLM 課程發布
vLLM 與 DeepLearning.AI 和 Red Hat 合作,推出了一個免費的中級課程,名為 Fast & Efficient LLM Inference with vLLM,旨在教授完整的 AI 部署生命週期。
vLLM Session-Aware Agentic Routing (SAAR) 發布
vLLM 推出 Session-Aware Agentic Routing (SAAR),這是一種模型選擇政策,透過在工具循環和提供者狀態過程中防止不安全的模型切換,來保持會話連續性並降低長時程 LLM 代理的成本。
vLLM-Omni 透過 AutoRound 量化加速推理
vLLM-Omni 現在整合了 Intel 的 AutoRound 訓練後量化技術,實現了 W4A16 量化,在保持準確度的同時,可減少高達 62% 的模型大小,並在 Intel XPU 和 NVIDIA GPU 上釋放性能增益。
vLLM 在 DGX Spark 上:架構、設定與本地評估
vLLM 為 NVIDIA DGX Spark 提供高效能的本地推論端點,透過統一記憶體架構與相容 OpenAI 的 API,使得部署大型 NVFP4 模型(如 Nemotron-3-Super)成為可能。
Speculators v0.5.0 發行說明 / 新功能
Speculators v0.5.0 引入 DFlash 演算法支援,用於單通過草稿 token 生成,透過 vLLM 原生隱藏狀態提取統一線上與離線訓練,並更新文件。
vLLM Semantic Router 多模態路由與視覺編碼器強化
vLLM 已在 Semantic Router (VSR) 中引入了多模態路由,使系統能夠將視覺證據作為請求層級策略決策的一等公民信號,同時解決了 Rust/Candle 與 PyTorch 路徑之間關鍵的實作漂移問題。
使用 vLLM、Speculators 與 LLM Compressor 進行 Laguna XS.2 推論優化
Poolside 與 Red Hat AI 透過 vLLM 整合、DFlash 投機解碼與 LLM Compressor 量化,針對代理編碼任務優化了 Laguna XS.2 33B-A3B MoE 模型。