vLLM Arm CPU向け最適化
vLLMは、Arm Neoverseベースのサーバー向けにフルスタックの最適化を実装し、メモリ割り当て、同期、量子化の改善によりスループットを最大6.2倍向上させました。
vLLM Speculators: 並列ドラフティングによるスペキュラティブデコーディング
vLLM と Speculators プロジェクトは、P-EAGLE、DFlash、DSpark のオープンソース サポートを導入し、自己回帰ドラフティングを超えて並列で候補トークン ブロックを生成し、LLM の推論を高速化します。
vLLM Kimi K3 サポート
vLLM は、2.8兆パラメータのマルチモーダル MoE モデルである Kimi K3 に対する day-0 サポートをリリースしました。Kimi Delta Attention と DSpark speculative decoding の最適化により、最大 370 tok/s を達成しています。
vLLM AFD Plugin: MoE サービングのための Attention と FFN の分離
vLLM AFD Plugin は Attention-FFN Disaggregation (AFD) を導入し、Mixture-of-Experts (MoE) モデルの Attention パスと FFN パスを独立してスケーリングおよび実行できるようにすることで、サービングのスループットとレイテンシを最適化します。
vLLMによるNVIDIA B300 GPU上でのGLM-5.2のサービング
vLLMは、P/D disaggregation、speculative padding、およびIndexerCacheの最適化を実装することにより、24枚のNVIDIA B300 GPU上でGLM-5.2-NVFP4のプロダクションSLA遵守を実現しました。
vLLM Kimi K3 サポートプレビュー
vLLMは、ハイブリッドKDA/フルアテンションアーキテクチャとネイティブビジョンサポートを特徴とする2.8兆パラメーターモデルであるMoonshot AIのKimi K3に対するday-0オープンソースサービングサポートの準備を進めています。
単一モデルを超えて:vLLM Semantic Router で Mixture-of-Models システムを構築
vLLM Semantic Router は、単一のモデルインターフェースを通じて複数の独立したモデルを調整する Mixture-of-Models システムの構築、バージョン管理、およびデプロイを可能にします。
vLLM Production Quality: CI, Benchmarking, and Release Process Overview
vLLMは、継続的インテグレーション、パフォーマンス・ベンチマーク、および厳格なリリースプロセスからなる3層の品質保証フレームワークを利用して、膨大な種類のハードウェアとモデルアーキテクチャにわたる安定性を維持しています。
vLLM TML Inkling サポート
vLLM は、1T パラメータのマルチモーダルモデルである TML Inkling の Day-0 サポートを発表しました。専門的なアーキテクチャ最適化により、4 つの GB200 GPU で最大 380 tok/s/user のスループットを実現します。
vLLM と TileRT のレイテンシクリティカルなサービング統合
vLLM は TileRT 0.1.5 をプラガブルなデコードエンジンとして統合し、レイテンシクリティカルなワークロードに対してネイティブなユーザーごとのデコード速度を提供しつつ、vLLM の標準的なプリフィルおよびサービングインフラストラクチャを維持します。
EAGLE-3 スペキュラティブ デコーディング on AMD Instinct GPUs
vLLM と AMD Quark は、AMD Instinct GPU 上で EAGLE-3 スペキュラティブ デコーディングのエンドツーエンド パイプラインを実装し、Kimi-K2.5 に対して最大 2.00x、MiniMax-M2.5 に対して最大 1.79x のスループット向上を達成しました。
vime の AMD Instinct GPU 向け ROCm サポート
vLLM は vime の ROCm サポートを発表し、AMD Instinct MI300X および MI355X GPU 上でエンドツーエンドの強化学習ポストトレーニングワークフローをネイティブに実行できるようにしました。
vLLM × HPC-Ops: 高性能 Attention と MoE バックエンド、Tencent Hunyuan から
vLLM は現在、NVIDIA Hopper H20 に最適化された HPC-Ops Attention および MoE バックエンドを含んでおり、Attention の速度向上は最大 2.95×、MoE の速度向上は 1.59× を実現し、Hy3 において TTFT を約 24%、TPOT を約 17% 削減します。
vLLM-Omni による Qwen3-Omni-30B-A3B-Instruct サービングの最適化
vLLM-Omni は Qwen3-Omni-30B-A3B-Instruct を 3 ステージのパイプライン(Thinker、Talker、Code2Wav)を介してサービングし、ステージ分解、CUDA Graphs、非同期チャンクハンドオフ、非同期出力、ステージレプリカ、およびホットパスのクリーンアップを使用してスループットとレイテンシを向上させます。
vLLM Semantic Router: マイクロエージェント協調によるモデル性能の向上
vLLMは、Semantic Routerというサービングレイヤーのプリミティブを導入し、単一のモデルAPIコールをマイクロエージェントの有界な協調に変換し、複雑なベンチマークにおいてフロンティアモデルを上回る性能を達成します。
vLLM-Omni TTS 推論エンジニアリング
vLLM-Omni は、Qwen3-TTS、VoxCPM2、Higgs Audio V3、Fish Speech S2 Pro などのモデルに対して、レイテンシーとスループットのボトルネックを分離するモデル固有の最適化を適用することで TTS 推論をエンジニアリングし、オーディオスループットを大幅に向上させ、エンドツーエンドレイテンシーを削減しました。
vLLM Semantic Router Fusion プリミティブがプログラム可能なマルチモデルサービングを実現
vLLM は Semantic Router 用に Fusion プリミティブを導入し、プログラム可能なマルチモデルパネル、評価、合成を第一級のサービングパターンとして実現しました。
MiniMax M3 vLLM サポート:1M トークンマルチモーダル推論の Day-0 サービング
vLLM は MiniMax M3 モデルファミリーに対する Day-0 サポートをリリースし、MiniMax Sparse Attention (MSA) を使用した 1M トークンコンテキストとネイティブなマルチモーダル推論の効率的なサービングを可能にしました。
DiffusionGemma: vLLMでネイティブにサポートされた初のDiffusion LLM
vLLMは26Bパラメータの離散拡散言語モデルであるDiffusionGemmaを統合しました。これにより、逐次的な自己回帰デコーディングの代わりにトークンブロックを反復的にデノイズすることで、高スループットかつ低レイテンシな生成が可能になります。
vime RL フレームワーク リリース
vLLMは、MegatronトレーニングとvLLM推論を統合し、LLM強化学習のための安定かつ効率的なパイプラインを提供するオープンソースのRLポストトレーニングフレームワークであるvimeを発表しました。
vLLM Semantic Router v0.3 Themis リリースノート
vLLM Semantic Router v0.3 Themisは、Session-Aware Agentic Routing (SAAR)、標準的な設定コントラクト、およびAMD ROCmとIntel OpenVINOへの拡張されたハードウェアサポートを特徴とする、ステートフルなプロダクション・ルーティングを導入します。
NVIDIA Nemotron 3 Ultra Support on vLLM
vLLM は、ハイブリッド Transformer-Mamba MoE アーキテクチャを通じて長時間実行される自律エージェント ワークフローに最適化された 550B パラメータ モデルである NVIDIA Nemotron 3 Ultra の Day-0 サポートを発表しました。
高速かつ効率的 LLM 推論 with vLLM コース ローンチ
vLLMはDeepLearning.AIおよびRed Hatと協力し、無料の中級コース「Fast & Efficient LLM 推論 with vLLM」を立ち上げ、AIデプロイメントのフルライフサイクルを教える。
vLLM セッション認識エージェントルーティング (SAAR) リリース
vLLM は、ツールループやプロバイダー状態遷移中の安全でないモデル切り替えを防ぐことで、長時間範囲の LLM エージェントのセッション継続性を保ち、コストを削減するモデル選択ポリシーである Session-Aware Agentic Routing (SAAR) を導入します。
vLLM-Omni が AutoRound 量子化で推論を加速
vLLM-Omni は Intel の AutoRound 事後学習量子化を統合し、モデルサイズを最大 62% 短縮しつつ精度を維持し、Intel XPU と NVIDIA GPU での性能向上を実現する W4A16 量子化を可能にしました。
DGX Spark上のvLLM:アーキテクチャ、構成、ローカル評価
vLLMはNVIDIA DGX Spark向けに高性能なローカル推論エンドポイントを提供し、統合メモリアーキテクチャとOpenAI互換APIを用いてNemotron-3-Superのような大規模NVFP4モデルのデプロイを可能にします。
Laguna XS.2 推論の最適化: vLLM、Speculators、LLM Compressor を使用
Poolside と Red Hat AI は、vLLM 統合、DFlash スペキュラティブ デコーディング、LLM Compressor 量子化を使用して、Laguna XS.2 33B-A3B MoE モデルをエージェンティック コーディング タスク向けに最適化しました。
vLLM セマンティックルーターのマルチモーダルルーティングとビジョンエンコーダの強化
vLLM はセマンティックルーター (VSR) にマルチモーダルルーティングを導入し、システムが視覚的証拠をリクエストレベルのポリシー決定における第一級シグナルとして使用できるようにしました。また、Rust/Candle と PyTorch パス間の重要な実装ドリフトを解消しています。
Speculators v0.5.0 リリースノート / 新機能
Speculators v0.5.0は、シングルパスドラフトトークン生成のためのDFlashアルゴリズムサポート、vLLMのネイティブ隠れ状態抽出を介したオンラインおよびオフライントレーニングの統合、およびドキュメントの更新を導入します。
vLLM ネイティブ RL API リリース
vLLM は、トレーニングと推論間の重み転送を標準化し、大規模な DPEP デプロイメントでのデッドロックを解消するため、ネイティブな重み同期 API と改善された非同期 RL サポートを導入しました。
EAGLE 3.1 リリースノート: 推測デコードの堅牢性と効率性の向上
EAGLE 3.1 はアーキテクチャ改善によりアテンションドリフトを解消し、長文コンテキストワークロードで受容長さを倍増させ、vLLM と TorchSpec の統合を通じてスループットを大幅に向上させます。
vLLM x Novita AI: 本番環境向け外部KVキャッシュのためのPegaFlow
vLLMとNovita AIは、KVキャッシュをvLLMワーカーから分離し、キャッシュ共有によるスループット向上とRDMAベースのノード間アクセスを可能にする外部KVキャッシュサービス「PegaFlow」を発表しました。
VeRL-Omni: 拡散およびオムニモダリティモデル向けRLトレーニングフレームワーク
vLLMは、マルチモーダル生成モデル、特に拡散およびオムニモダリティアーキテクチャ向けに設計された汎用の強化学習ポストトレーニングフレームワークであるVeRL-Omniのプレリリースを発表しました。
vLLM Elastic Expert Parallelism
vLLMはElastic Expert Parallelism (Elastic EP)を導入しました。これにより、Mixture-of-Experts (MoE) デプロイメントにおいて、サーバーの再起動を必要とせずに、実行時にワーカー数を増減させることが可能になります。
vLLM パフォーマンスベンチマーク: Artificial Analysis リーダーボードでトップに立つ
vLLM は、DeepSeek V3.2、MiniMax-M2.5、そして Qwen 3.5 397B に対して、積極的なカーネル融合と投機的デコード最適化を実装することで、Artificial Analysis リーダーボードでトップランクを獲得しました。
vLLM TurboQuant Study: 正確性とパフォーマンス分析
vLLM による包括的な調査は、KV‑cache 量子化のデフォルトとして FP8 が依然として最適であることを示し、TurboQuant 系列は追加メモリ容量と引き換えにスループットとレイテンシの大幅な低下を伴うことが分かりました。
vLLM x Mooncake による大規模なエージェンティック・ワークロードのサービング
vLLM は Mooncake の分散 KV キャッシュストアを統合することで、エージェンティック LLM サービングを強化し、現実的なトレースにおいてスループットを 3.8 倍向上、TTFT を 46 倍低減、エンドツーエンドのレイテンシを 8.6 倍削減し、60 GB200 GPU へのスケーリングを実現しました。
vLLM における NVIDIA Nemotron 3 Nano Omni のサポート
vLLM は現在、NVIDIA Nemotron 3 Nano Omni をサポートしています。このモデルは、視覚、音声、言語の推論を単一のループに統合し、エージェントAIを実現する、非常に効率的な 30B MoE マルチモーダルモデルです。
vLLM DeepSeek V4 サポート: 効率的な長文コンテキスト注意機構
vLLM は現在、DeepSeek V4-Pro と V4-Flash をサポートし、新しいアテンション機構を実装してコンテキスト長を最大 100 万トークンまで拡張し、KV キャッシュのメモリを大幅に削減します。
vLLM FP8 KV-Cache と Attention 量子化のアップデート
vLLM は、Hopper と Blackwell アーキテクチャ全体でほぼベースラインの精度を維持しながら、デコード遅延とメモリ使用量を削減するために FP8 KV-cache と Attention 量子化を最適化しました。
vLLM v0.20.0 はハイブリッド SSM モデル向けに分散サービングを追加
vLLM v0.20.0 はハイブリッド SSM-FA モデル向けに分散型プレフィル/デコードサービングを導入し、デュアルディスクリプタビューと 3 ディスクリプタの conv ステート転送により効率的な KV 転送を実現します。
vLLM Korea Meetup 2026 ラップアップ
ソウルでの vLLM Korea Meetup 2026 は、vLLM が統合推論インフラストラクチャへと進化したことを強調し、コミュニティの成長、ハードウェア統合の進展、本番スタックの機能、オープンソースおよびエンタープライズ トラック全体にわたる実際のデプロイメント戦略を紹介しました。
vLLM Prefill-Decode の MORI-IO による分散化
vLLM は AMD の MORI-IO コネクタを使用して、単一ノードの 8 GPU MI300X 環境で Prefill-Decode の分散化を実装し、Inter-Token Latency のスパイクを排除することで、スループットを 2.5 倍に向上させました。
Gemma 4 on vLLM: 高度な推論とマルチモーダル機能
vLLMは、GoogleのオープンモデルファミリーであるGemma 4に対するDay 0サポートを導入しました。高度な推論、マルチモーダル入力、そしてTPU、GPU、XPUにわたる幅広いハードウェア互換性を備えています。
vLLM 隠れ状態抽出システム
vLLM v0.18.0 は、投機的デコードのドラフトモデル訓練のために内部モデル表現を高性能で取得できるネイティブな隠れ状態抽出システムを導入しました。
vLLM Model Runner V2 リリースノート / 新機能
vLLM は Model Runner V2(MRV2)を導入しました。これはモデルランナーをゼロから再実装したもので、GPU ネイティブかつ非同期優先、モジュラーなアーキテクチャによりスループットを向上させ、レイテンシを低減します。
P-EAGLE: vLLM における並列投機的デコード
vLLM は、すべてのドラフトトークンを単一のフォワードパスで生成する並列投機的デコード手法 P-EAGLE を導入し、NVIDIA B200 GPU 上で従来の EAGLE-3 に比べて最大 1.69 倍の速度向上を実現します。
vLLM における NVIDIA Nemotron 3 Super のサポート
vLLM は、マルチエージェント AI 向けに最適化された 1200 億パラメータのハイブリッド MoE モデルである NVIDIA Nemotron 3 Super をサポートし、100 万トークンのコンテキストウィンドウと高い推論効率を実現します。
vLLM Semantic Router v0.2 Athena リリースノート / 新機能
vLLM Semantic Router v0.2 Athena は、モデルスタックを全面的に再構築し、実験的な ClawOS オーケストレーションレイヤーと高度なモデル選択プリミティブを導入することで、セマンティックルーティングをマルチエージェント展開向けの戦略的システムブレインへと変換します。
vLLM Triton アテンションバックエンドの深掘り
vLLM は、単一のソースコード実装で NVIDIA、AMD、Intel の GPU 全体で最先端の性能を実現する、ポータブルな Triton ベースのアテンションバックエンドを実装しました。