✷ アーカイブ · ラボ 11 拠点 · ディスパッチ 73 件
ラボ
毎朝十数個の公式ブログを開いて回る必要はありません。OpenAI、Anthropic、DeepMind などの一次発表を、要点を抜き出した形で。
vLLM ネイティブ RL API リリース
vLLM は、トレーニングと推論間の重み転送を標準化し、大規模な DPEP デプロイメントでのデッドロックを解消するため、ネイティブな重み同期 API と改善された非同期 RL サポートを導入しました。
EAGLE 3.1 リリースノート: 推測デコードの堅牢性と効率性の向上
EAGLE 3.1 はアーキテクチャ改善によりアテンションドリフトを解消し、長文コンテキストワークロードで受容長さを倍増させ、vLLM と TorchSpec の統合を通じてスループットを大幅に向上させます。
vLLM x Novita AI: 本番環境向け外部KVキャッシュのためのPegaFlow
vLLMとNovita AIは、KVキャッシュをvLLMワーカーから分離し、キャッシュ共有によるスループット向上とRDMAベースのノード間アクセスを可能にする外部KVキャッシュサービス「PegaFlow」を発表しました。
VeRL-Omni: 拡散およびオムニモダリティモデル向けRLトレーニングフレームワーク
vLLMは、マルチモーダル生成モデル、特に拡散およびオムニモダリティアーキテクチャ向けに設計された汎用の強化学習ポストトレーニングフレームワークであるVeRL-Omniのプレリリースを発表しました。
vLLM Elastic Expert Parallelism
vLLMはElastic Expert Parallelism (Elastic EP)を導入しました。これにより、Mixture-of-Experts (MoE) デプロイメントにおいて、サーバーの再起動を必要とせずに、実行時にワーカー数を増減させることが可能になります。
vLLM パフォーマンスベンチマーク: Artificial Analysis リーダーボードでトップに立つ
vLLM は、DeepSeek V3.2、MiniMax-M2.5、そして Qwen 3.5 397B に対して、積極的なカーネル融合と投機的デコード最適化を実装することで、Artificial Analysis リーダーボードでトップランクを獲得しました。
vLLM TurboQuant Study: 正確性とパフォーマンス分析
vLLM による包括的な調査は、KV‑cache 量子化のデフォルトとして FP8 が依然として最適であることを示し、TurboQuant 系列は追加メモリ容量と引き換えにスループットとレイテンシの大幅な低下を伴うことが分かりました。
vLLM x Mooncake による大規模なエージェンティック・ワークロードのサービング
vLLM は Mooncake の分散 KV キャッシュストアを統合することで、エージェンティック LLM サービングを強化し、現実的なトレースにおいてスループットを 3.8 倍向上、TTFT を 46 倍低減、エンドツーエンドのレイテンシを 8.6 倍削減し、60 GB200 GPU へのスケーリングを実現しました。
vLLM における NVIDIA Nemotron 3 Nano Omni のサポート
vLLM は現在、NVIDIA Nemotron 3 Nano Omni をサポートしています。このモデルは、視覚、音声、言語の推論を単一のループに統合し、エージェントAIを実現する、非常に効率的な 30B MoE マルチモーダルモデルです。
vLLM DeepSeek V4 サポート: 効率的な長文コンテキスト注意機構
vLLM は現在、DeepSeek V4-Pro と V4-Flash をサポートし、新しいアテンション機構を実装してコンテキスト長を最大 100 万トークンまで拡張し、KV キャッシュのメモリを大幅に削減します。
vLLM FP8 KV-Cache と Attention 量子化のアップデート
vLLM は、Hopper と Blackwell アーキテクチャ全体でほぼベースラインの精度を維持しながら、デコード遅延とメモリ使用量を削減するために FP8 KV-cache と Attention 量子化を最適化しました。
vLLM v0.20.0 はハイブリッド SSM モデル向けに分散サービングを追加
vLLM v0.20.0 はハイブリッド SSM-FA モデル向けに分散型プレフィル/デコードサービングを導入し、デュアルディスクリプタビューと 3 ディスクリプタの conv ステート転送により効率的な KV 転送を実現します。
vLLM Korea Meetup 2026 ラップアップ
ソウルでの vLLM Korea Meetup 2026 は、vLLM が統合推論インフラストラクチャへと進化したことを強調し、コミュニティの成長、ハードウェア統合の進展、本番スタックの機能、オープンソースおよびエンタープライズ トラック全体にわたる実際のデプロイメント戦略を紹介しました。
vLLM Prefill-Decode の MORI-IO による分散化
vLLM は AMD の MORI-IO コネクタを使用して、単一ノードの 8 GPU MI300X 環境で Prefill-Decode の分散化を実装し、Inter-Token Latency のスパイクを排除することで、スループットを 2.5 倍に向上させました。
Gemma 4 on vLLM: 高度な推論とマルチモーダル機能
vLLMは、GoogleのオープンモデルファミリーであるGemma 4に対するDay 0サポートを導入しました。高度な推論、マルチモーダル入力、そしてTPU、GPU、XPUにわたる幅広いハードウェア互換性を備えています。
vLLM 隠れ状態抽出システム
vLLM v0.18.0 は、投機的デコードのドラフトモデル訓練のために内部モデル表現を高性能で取得できるネイティブな隠れ状態抽出システムを導入しました。
vLLM Model Runner V2 リリースノート / 新機能
vLLM は Model Runner V2(MRV2)を導入しました。これはモデルランナーをゼロから再実装したもので、GPU ネイティブかつ非同期優先、モジュラーなアーキテクチャによりスループットを向上させ、レイテンシを低減します。
P-EAGLE: vLLM における並列投機的デコード
vLLM は、すべてのドラフトトークンを単一のフォワードパスで生成する並列投機的デコード手法 P-EAGLE を導入し、NVIDIA B200 GPU 上で従来の EAGLE-3 に比べて最大 1.69 倍の速度向上を実現します。
vLLM における NVIDIA Nemotron 3 Super のサポート
vLLM は、マルチエージェント AI 向けに最適化された 1200 億パラメータのハイブリッド MoE モデルである NVIDIA Nemotron 3 Super をサポートし、100 万トークンのコンテキストウィンドウと高い推論効率を実現します。
vLLM Semantic Router v0.2 Athena リリースノート / 新機能
vLLM Semantic Router v0.2 Athena は、モデルスタックを全面的に再構築し、実験的な ClawOS オーケストレーションレイヤーと高度なモデル選択プリミティブを導入することで、セマンティックルーティングをマルチエージェント展開向けの戦略的システムブレインへと変換します。
vLLM Triton アテンションバックエンドの深掘り
vLLM は、単一のソースコード実装で NVIDIA、AMD、Intel の GPU 全体で最先端の性能を実現する、ポータブルな Triton ベースのアテンションバックエンドを実装しました。
vLLM AMD ROCm アテンションバックエンド最適化
vLLM は AMD ROCm 向けに最適化されたアテンションバックエンドを導入し、Instinct MI300X、MI325X、MI355X GPU 上で MHA のスループットを最大 4.4 倍、MLA モデルを最大 1.5 倍向上させます。
vLLM の MoE モデル向け Multi-LoRA サービング
vLLM バージョン 0.15.0 は、Mixture of Experts(MoE)モデル向けに最適化された Multi-LoRA サービングを導入し、複数のファインチューニングされたアダプタが単一の GPU を共有できるようにして、アイドル状態の計算リソースを削減します。