アーカイブ · ラボ 11 拠点 · ディスパッチ 69 件

ラボ

毎朝十数個の公式ブログを開いて回る必要はありません。OpenAI、Anthropic、DeepMind などの一次発表を、要点を抜き出した形で。

01

AMD Instinct MI355X 上での MiniMax M3 の最適化

vLLM は、AMD Instinct MI355X 上での MiniMax M3 について、段階的なボトルネック駆動型の最適化プロセスを通じて、並行性 32 での MXFP8 出力トークン数/s/GPU を 109.1 から 342.4 まで大幅に向上させました。

02

vLLMの階層的KVキャッシュオフロード

vLLMは、解放されたキー・バリュー(KV)データをホストメモリ、ストレージ、およびリモートピアに保持する階層的KVキャッシュオフロードを導入し、再計算を回避し、レイテンシを削減し、サービング容量を向上させます。

03

vLLM GLM 5.3 最適化: ハイブリッド HiSparse オフロード

vLLM は GLM 5.3 用にハイブリッド HiSparse オフロードを導入し、メモリ圧力時に KV キャッシュを CPU メモリに動的にオフロードすることで、単一の 8x H200 ノード上で最大 100 万トークンのコンテキスト長を実現し、並行性を向上させます。

04

vLLM AgentXリリース:現実世界のエージェントサービングを最適化する

vLLMは、KVキャッシュ、並列化、スケジューリングの最適化を統合し、DeepSeek V4 Pro、MiniMax M3、Kimi K3などのエージェントワークロードにおいて、1GPU秒あたり最大13万トークンの性能と、Opus 5と比較して14.6倍~106倍のコスト優位性を達成しました。

05

vLLM TT プラグインが Tenstorrent アクセラレータを LLM サービングに導入

vLLM TT プラグインは、フェーズベーススケジューラ、デバイス内サンプリング、およびプロセス内ラン データ並列を用いて、Tenstorrent メッシュハードウェア上で OpenAI 互換の LLM サービングを可能にします。

06

vLLM GLM 5.3 最適化: Hybrid HiSparse オフローディング

vLLM は GLM 5.3 用に Hybrid HiSparse オフローディングを導入し、8x H200 ノードのようなメモリ制約のあるハードウェア上で、100 万トークンのフルコンテキスト長とより高い並列実行を可能にします。

07

vLLM-OmniによるMiniMax H3 FastH3のリアルタイムサービング

vLLM-OmniはFastVideoのFastH3スチューデントモデルを統合し、再生よりも速く完全なMiniMax H3のビデオ・音声MP4を生成し、8つのGPUを搭載したB300システムでリアルタイムのレイテンシを実現します。

08

vLLMのAMD GPUにおける推測的デコード:パフォーマンスと手法

vLLMはAMD Instinct MI300X/MI355X GPUに推測的デコードを導入し、軽量なドラフトモデルが複数のトークンを提案し、ターゲットモデルが1回の順伝播で検証する仕組みを可能にします。これにより、ドラフト手法、モデルファミリー、提案長に応じて出力トークンスループットが2倍以上に向上します。

09

vLLM Ray Direct Transport による大規模シャード化された重みの転送

vLLM は、Ray Direct Transport (RDT) を使用したシャード化された重み転送エンジンを導入し、オンライン RL 設定における兆単位のパラメータを持つモデルの効率的で障害耐性のある重み同期を可能にします。

10

IsoExec: SkyRLにおけるトレーナーと推論のミスマッチを解消する

vLLMは、実行契約と並列性不変カーネルを通じて、RLワークロードにおけるトレーニングエンジンと推論エンジンの間の数値的なミスマッチを解消する、統合実行抽象化であるIsoExecを導入しました。

11

VeRL-Omni v0.2.0 release notes / what's new

VeRL-Omni v0.2.0は、diffusion RLの高速化のためのrequest-level batchingと、安定したマルチモーダル自己回帰トレーニングのための再利用可能なオムニトレーニングスタックを導入しています。

12

vLLM-Omni 分散レイヤーワイズオフロード

vLLM-Omniは、重みシャーディングとダブルバッファドプリフェッチを活用してHBMおよびホストメモリ使用量を最適化することで、200Bパラメータを超える大規模なDiffusion Transformer(DiT)モデルを効率的に提供する分散レイヤーワイズオフロード(DLO)を導入しています。

13

DSparkを用いたvLLMの適応型検証

vLLMは、DSparkの信頼度ヘッドを使用して、ステップごとに検証される投機トークン数を動的に調整し、さまざまな並列度において高いスループットを維持する適応型検証を導入しました。

14

vLLM Day 0 Support for Qwen3.8-2.4T-A95B

vLLMは、Qwen-Maxクラスの機能をオープンウェイトで提供する2.4兆パラメータの疎なMoEモデル、Qwen3.8-2.4T-A95BのDay-0サポートを発表しました。

15

vLLMにおけるNVIDIA Nemotron 3.5 LightningのDay-0サポート

NVIDIAは、30BのNemotron 3.5 Lightningモデルに対するDay-0のvLLMサポートをリリースしました。ハイブリッドMoEアーキテクチャと3つの投機的デコーディング技術により、高速で常時稼働可能なエージェント推論を可能にします。

16

vLLM Decode Context Parallelism for Long Context Workloads

vLLMは、KVキャッシュをシーケンス次元でGPU間に分割するDecode Context Parallelism (DCP) を導入し、長文コンテキストのエージェント的ワークロードにおける同時実行数とスループットを大幅に向上させます。

17

vLLM Qwen3.5 パフォーマンス最適化

vLLMは、Blackwell向けに最適化されたカーネル、ハイブリッド・キャッシュ状態転送、および非同期スケジューリングを通じて、GB200 NVL72システム上のQwen3.5において、GPUあたり25,000トークン/秒(TPS)を超える合計スループットを達成しました。

18

vLLM Arm CPU向け最適化

vLLMは、Arm Neoverseベースのサーバー向けにフルスタックの最適化を実装し、メモリ割り当て、同期、量子化の改善によりスループットを最大6.2倍向上させました。

19

vLLM Speculators: 並列ドラフティングによるスペキュラティブデコーディング

vLLM と Speculators プロジェクトは、P-EAGLE、DFlash、DSpark のオープンソース サポートを導入し、自己回帰ドラフティングを超えて並列で候補トークン ブロックを生成し、LLM の推論を高速化します。

20

vLLM Kimi K3 サポート

vLLM は、2.8兆パラメータのマルチモーダル MoE モデルである Kimi K3 に対する day-0 サポートをリリースしました。Kimi Delta Attention と DSpark speculative decoding の最適化により、最大 370 tok/s を達成しています。

21

vLLM AFD Plugin: MoE サービングのための Attention と FFN の分離

vLLM AFD Plugin は Attention-FFN Disaggregation (AFD) を導入し、Mixture-of-Experts (MoE) モデルの Attention パスと FFN パスを独立してスケーリングおよび実行できるようにすることで、サービングのスループットとレイテンシを最適化します。

22

vLLMによるNVIDIA B300 GPU上でのGLM-5.2のサービング

vLLMは、P/D disaggregation、speculative padding、およびIndexerCacheの最適化を実装することにより、24枚のNVIDIA B300 GPU上でGLM-5.2-NVFP4のプロダクションSLA遵守を実現しました。

23

vLLM Kimi K3 サポートプレビュー

vLLMは、ハイブリッドKDA/フルアテンションアーキテクチャとネイティブビジョンサポートを特徴とする2.8兆パラメーターモデルであるMoonshot AIのKimi K3に対するday-0オープンソースサービングサポートの準備を進めています。

24

単一モデルを超えて:vLLM Semantic Router で Mixture-of-Models システムを構築

vLLM Semantic Router は、単一のモデルインターフェースを通じて複数の独立したモデルを調整する Mixture-of-Models システムの構築、バージョン管理、およびデプロイを可能にします。

25

vLLM Production Quality: CI, Benchmarking, and Release Process Overview

vLLMは、継続的インテグレーション、パフォーマンス・ベンチマーク、および厳格なリリースプロセスからなる3層の品質保証フレームワークを利用して、膨大な種類のハードウェアとモデルアーキテクチャにわたる安定性を維持しています。

26

vLLM TML Inkling サポート

vLLM は、1T パラメータのマルチモーダルモデルである TML Inkling の Day-0 サポートを発表しました。専門的なアーキテクチャ最適化により、4 つの GB200 GPU で最大 380 tok/s/user のスループットを実現します。

27

vLLM と TileRT のレイテンシクリティカルなサービング統合

vLLM は TileRT 0.1.5 をプラガブルなデコードエンジンとして統合し、レイテンシクリティカルなワークロードに対してネイティブなユーザーごとのデコード速度を提供しつつ、vLLM の標準的なプリフィルおよびサービングインフラストラクチャを維持します。

28

EAGLE-3 スペキュラティブ デコーディング on AMD Instinct GPUs

vLLM と AMD Quark は、AMD Instinct GPU 上で EAGLE-3 スペキュラティブ デコーディングのエンドツーエンド パイプラインを実装し、Kimi-K2.5 に対して最大 2.00x、MiniMax-M2.5 に対して最大 1.79x のスループット向上を達成しました。

29

vime の AMD Instinct GPU 向け ROCm サポート

vLLM は vime の ROCm サポートを発表し、AMD Instinct MI300X および MI355X GPU 上でエンドツーエンドの強化学習ポストトレーニングワークフローをネイティブに実行できるようにしました。

30

vLLM × HPC-Ops: 高性能 Attention と MoE バックエンド、Tencent Hunyuan から

vLLM は現在、NVIDIA Hopper H20 に最適化された HPC-Ops Attention および MoE バックエンドを含んでおり、Attention の速度向上は最大 2.95×、MoE の速度向上は 1.59× を実現し、Hy3 において TTFT を約 24%、TPOT を約 17% 削減します。

31

vLLM-Omni による Qwen3-Omni-30B-A3B-Instruct サービングの最適化

vLLM-Omni は Qwen3-Omni-30B-A3B-Instruct を 3 ステージのパイプライン(Thinker、Talker、Code2Wav)を介してサービングし、ステージ分解、CUDA Graphs、非同期チャンクハンドオフ、非同期出力、ステージレプリカ、およびホットパスのクリーンアップを使用してスループットとレイテンシを向上させます。

32

vLLM Semantic Router: マイクロエージェント協調によるモデル性能の向上

vLLMは、Semantic Routerというサービングレイヤーのプリミティブを導入し、単一のモデルAPIコールをマイクロエージェントの有界な協調に変換し、複雑なベンチマークにおいてフロンティアモデルを上回る性能を達成します。

33

vLLM-Omni TTS 推論エンジニアリング

vLLM-Omni は、Qwen3-TTS、VoxCPM2、Higgs Audio V3、Fish Speech S2 Pro などのモデルに対して、レイテンシーとスループットのボトルネックを分離するモデル固有の最適化を適用することで TTS 推論をエンジニアリングし、オーディオスループットを大幅に向上させ、エンドツーエンドレイテンシーを削減しました。

34

vLLM Semantic Router Fusion プリミティブがプログラム可能なマルチモデルサービングを実現

vLLM は Semantic Router 用に Fusion プリミティブを導入し、プログラム可能なマルチモデルパネル、評価、合成を第一級のサービングパターンとして実現しました。

35

MiniMax M3 vLLM サポート:1M トークンマルチモーダル推論の Day-0 サービング

vLLM は MiniMax M3 モデルファミリーに対する Day-0 サポートをリリースし、MiniMax Sparse Attention (MSA) を使用した 1M トークンコンテキストとネイティブなマルチモーダル推論の効率的なサービングを可能にしました。

36

DiffusionGemma: vLLMでネイティブにサポートされた初のDiffusion LLM

vLLMは26Bパラメータの離散拡散言語モデルであるDiffusionGemmaを統合しました。これにより、逐次的な自己回帰デコーディングの代わりにトークンブロックを反復的にデノイズすることで、高スループットかつ低レイテンシな生成が可能になります。

37

vime RL フレームワーク リリース

vLLMは、MegatronトレーニングとvLLM推論を統合し、LLM強化学習のための安定かつ効率的なパイプラインを提供するオープンソースのRLポストトレーニングフレームワークであるvimeを発表しました。

38

vLLM Semantic Router v0.3 Themis リリースノート

vLLM Semantic Router v0.3 Themisは、Session-Aware Agentic Routing (SAAR)、標準的な設定コントラクト、およびAMD ROCmとIntel OpenVINOへの拡張されたハードウェアサポートを特徴とする、ステートフルなプロダクション・ルーティングを導入します。

39

NVIDIA Nemotron 3 Ultra Support on vLLM

vLLM は、ハイブリッド Transformer-Mamba MoE アーキテクチャを通じて長時間実行される自律エージェント ワークフローに最適化された 550B パラメータ モデルである NVIDIA Nemotron 3 Ultra の Day-0 サポートを発表しました。

40

高速かつ効率的 LLM 推論 with vLLM コース ローンチ

vLLMはDeepLearning.AIおよびRed Hatと協力し、無料の中級コース「Fast & Efficient LLM 推論 with vLLM」を立ち上げ、AIデプロイメントのフルライフサイクルを教える。

41

vLLM セッション認識エージェントルーティング (SAAR) リリース

vLLM は、ツールループやプロバイダー状態遷移中の安全でないモデル切り替えを防ぐことで、長時間範囲の LLM エージェントのセッション継続性を保ち、コストを削減するモデル選択ポリシーである Session-Aware Agentic Routing (SAAR) を導入します。

42

vLLM-Omni が AutoRound 量子化で推論を加速

vLLM-Omni は Intel の AutoRound 事後学習量子化を統合し、モデルサイズを最大 62% 短縮しつつ精度を維持し、Intel XPU と NVIDIA GPU での性能向上を実現する W4A16 量子化を可能にしました。

43

DGX Spark上のvLLM:アーキテクチャ、構成、ローカル評価

vLLMはNVIDIA DGX Spark向けに高性能なローカル推論エンドポイントを提供し、統合メモリアーキテクチャとOpenAI互換APIを用いてNemotron-3-Superのような大規模NVFP4モデルのデプロイを可能にします。

44

Speculators v0.5.0 リリースノート / 新機能

Speculators v0.5.0は、シングルパスドラフトトークン生成のためのDFlashアルゴリズムサポート、vLLMのネイティブ隠れ状態抽出を介したオンラインおよびオフライントレーニングの統合、およびドキュメントの更新を導入します。

45

vLLM セマンティックルーターのマルチモーダルルーティングとビジョンエンコーダの強化

vLLM はセマンティックルーター (VSR) にマルチモーダルルーティングを導入し、システムが視覚的証拠をリクエストレベルのポリシー決定における第一級シグナルとして使用できるようにしました。また、Rust/Candle と PyTorch パス間の重要な実装ドリフトを解消しています。

46

Laguna XS.2 推論の最適化: vLLM、Speculators、LLM Compressor を使用

Poolside と Red Hat AI は、vLLM 統合、DFlash スペキュラティブ デコーディング、LLM Compressor 量子化を使用して、Laguna XS.2 33B-A3B MoE モデルをエージェンティック コーディング タスク向けに最適化しました。

47

vLLM ネイティブ RL API リリース

vLLM は、トレーニングと推論間の重み転送を標準化し、大規模な DPEP デプロイメントでのデッドロックを解消するため、ネイティブな重み同期 API と改善された非同期 RL サポートを導入しました。

48

EAGLE 3.1 リリースノート: 推測デコードの堅牢性と効率性の向上

EAGLE 3.1 はアーキテクチャ改善によりアテンションドリフトを解消し、長文コンテキストワークロードで受容長さを倍増させ、vLLM と TorchSpec の統合を通じてスループットを大幅に向上させます。

49

vLLM x Novita AI: 本番環境向け外部KVキャッシュのためのPegaFlow

vLLMとNovita AIは、KVキャッシュをvLLMワーカーから分離し、キャッシュ共有によるスループット向上とRDMAベースのノード間アクセスを可能にする外部KVキャッシュサービス「PegaFlow」を発表しました。

50

VeRL-Omni: 拡散およびオムニモダリティモデル向けRLトレーニングフレームワーク

vLLMは、マルチモーダル生成モデル、特に拡散およびオムニモダリティアーキテクチャ向けに設計された汎用の強化学習ポストトレーニングフレームワークであるVeRL-Omniのプレリリースを発表しました。