✷ 封存 · 11 個實驗室 · 73 篇 dispatch
實驗室
不用每天手動刷十幾個官方部落格。OpenAI、Anthropic、DeepMind 等實驗室的一手發布,每篇都提煉出核心內容。
vLLM 原生 RL API 發布
vLLM 已引入原生權重同步 API 並改進異步 RL 支援,以標準化訓練與推理之間的權重傳輸,並消除大規模 DPEP 部署中的死鎖。
EAGLE 3.1 版本說明:提升推測解碼的韌性與效率
EAGLE 3.1 引入架構改進以解決注意力漂移,在長上下文工作負載中將可接受長度提升至兩倍,並透過 vLLM 與 TorchSpec 整合顯著提升吞吐量。
vLLM x Novita AI: PegaFlow 用於生產級外部 KV Cache
vLLM 與 Novita AI 宣布推出 PegaFlow,這是一個外部 KV cache 服務,它將 KV cache 與 vLLM worker 解耦,實現了更快的啟動速度、透過快取共享獲得更高的吞吐量,以及基於 RDMA 的跨節點存取。
VeRL-Omni: 擴散和全模態模型的強化學習訓練框架
vLLM 已宣布 VeRL-Omni 的預發布版本,這是一個專門為多模態生成模型(包括擴散和全模態架構)設計的通用強化學習後訓練框架。
vLLM 彈性專家並行 (Elastic Expert Parallelism)
vLLM 引入了彈性專家並行 (Elastic EP),使混合專家模型 (MoE) 部署能夠在運行時擴展或縮減工作節點數量,而無需重新啟動伺服器。
vLLM 效能基準:領先人工分析排行榜
vLLM 透過實施積極的核心融合與推測解碼優化,在人工分析排行榜上於 DeepSeek V3.2、MiniMax-M2.5 與 Qwen 3.5 397B 獲得最高排名。
vLLM TurboQuant 研究:準確性與效能分析
vLLM 的一項全面研究顯示,FP8 仍是 KV 快取量化的最佳預設選擇,而 TurboQuant 變體則以顯著的吞吐量與延遲為代價換取額外的記憶體容量。
使用 vLLM x Mooncake 大規模服務 Agentic 工作負載
vLLM 整合 Mooncake 的分散式 KV 快取存儲,以提升 Agentic LLM 服務,在真實追蹤上提供 3.8× 更高的吞吐量、46× 降低的 TTFT 與 8.6× 降低的端到端延遲,同時擴展至 60 個 GB200 GPU。
vLLM 中對 NVIDIA Nemotron 3 Nano Omni 的支援
vLLM 現已支援 NVIDIA Nemotron 3 Nano Omni,這是一款高效的 30 億參數 MoE 多模態模型,能在單一迴圈中統合視覺、音訊與語言推理,以驅動代理式 AI。
vLLM DeepSeek V4 支援:高效長上下文注意力
vLLM 現已支援 DeepSeek V4-Pro 與 V4-Flash,實作了一種新注意力機制,使上下文長度可達一百萬個 token,並大幅節省 KV cache 記憶體。
vLLM FP8 KV-Cache 與 Attention 量化更新
vLLM 已優化 FP8 KV-cache 與 attention 量化,在 Hopper 與 Blackwell 架構上降低了解碼延遲與記憶體使用量,同時保持接近基準的準確度。
vLLM v0.20.0 為混合 SSM 模型新增分散式服務
vLLM v0.20.0 為混合 SSM-FA 模型引入分散式 prefill/decode 服務,透過雙描述子視圖與三描述子卷積狀態傳輸,實現高效的 KV 傳輸。
vLLM Korea Meetup 2026 總結
vLLM Korea Meetup 2026 在首爾凸顯 vLLM 發展為統一的推理基礎設施,展示社區成長、硬體整合進展、生產堆疊功能,以及跨開源與企業軌道的真實部署策略。
vLLM Prefill-Decode 分散式架構與 MORI-IO
vLLM 在單節點 8 GPU MI300X 設備上使用 AMD 的 MORI-IO 連接器實現 Prefill-Decode 分散式架構,藉由消除 Inter-Token Latency 峰值,使效能提升 2.5 倍的 goodput。
Gemma 4 在 vLLM 上:先進推理與多模態能力
vLLM 為 Gemma 4 引入 Day 0 支援,這是一個來自 Google 的開放模型系列,具備先進推理、多模態輸入,且在 TPU、GPU 與 XPU 等多種硬體上皆具廣泛相容性。
vLLM 隱藏狀態提取系統
vLLM v0.18.0 引入了原生的隱藏狀態提取系統,使得在訓練投機解碼草稿模型時能高效取得模型內部表示。
vLLM Model Runner V2 版本說明 / 新功能
vLLM 推出了 Model Runner V2(MRV2),這是一個從頭重新實作的模型執行器,透過 GPU 原生、async‑first 與模組化的架構提升吞吐量並降低延遲。
P-EAGLE:vLLM 中的平行推測解碼
vLLM 引入了 P-EAGLE,一種平行推測解碼方法,能在單次前向傳播中生成所有草稿 token,於 NVIDIA B200 GPU 上相較於原始 EAGLE-3 提供最高 1.69 倍的加速。
vLLM 中的 NVIDIA Nemotron 3 Super 支援
vLLM 現已支援 NVIDIA Nemotron 3 Super,這是一個擁有 1200 億參數的混合 MoE 模型,針對多代理 AI 進行優化,具備 100 萬 token 的上下文窗口以及高效的推理效能。
vLLM Semantic Router v0.2 Athena 發行說明 / 新功能
vLLM Semantic Router v0.2 Athena 引入了全新重建的模型堆疊、實驗性的 ClawOS 協調層,以及先進的模型選擇原語,將語意路由轉變為多代理部署的策略性系統大腦。
vLLM Triton 注意力後端深度探討
vLLM 已實作一個可移植的基於 Triton 的注意力後端,透過單一源碼實作,在 NVIDIA、AMD 與 Intel GPU 上達到最先進的效能。
vLLM AMD ROCm 注意力後端最佳化
vLLM 為 AMD ROCm 引入了最佳化的注意力後端,在 Instinct MI300X、MI325X 與 MI355X GPU 上,為 MHA 模型提供最高 4.4 倍的吞吐量提升,為 MLA 模型提供最高 1.5 倍的提升。
vLLM 多 LoRA 服務於 MoE 模型
vLLM 0.15.0 版引入了針對混合專家(MoE)模型的優化多 LoRA 服務,讓多個微調適配器能共享單一 GPU,以降低閒置計算資源。