✷ アーカイブ · ラボ 11 拠点 · ディスパッチ 73 件
ラボ
毎朝十数個の公式ブログを開いて回る必要はありません。OpenAI、Anthropic、DeepMind などの一次発表を、要点を抜き出した形で。
vLLMのPyNvVideoCodecを用いたマルチGPU動画キャプションのスケーラビリティ向上
vLLMはPyNvVideoCodecを介してNVIDIAハードウェア動画デコードをサポートし、CPUボトルネックを除去し、H100 GPU上でマルチGPU動画キャプションタスクのスループットを2倍以上に向上させました。
vLLM Kimi-K3 DSpark Speculative Decoding Implementation
vLLMは、2.8TパラメータのKimi K3モデル向けにDSpark speculatorを実装しました。これにより、数学的推論のインタラクティビティが110から435 tok/s/userに向上し、出力スループットが最大3.5倍向上しました。
vLLM と Novita AI が Chord をリリース:Kimi K2.x 用の高速 INT4 MoE カーネル
Novita AI は、公開されている Humming カーネルと比較して最大 2.15× の高速化を実現する W4A16 MoE CUDA 演算子である Chord をオープンソース化しました。
vLLMにおけるKimi K3のパフォーマンス最適化
vLLMは、Kimi K3に対してスタック全体にわたる一連の最適化を実装し、その結果、スループットが最大2.8倍向上し、Time to First Token (TTFT) が最大85%削減されました。
AMD Instinct MI355X 上での MiniMax M3 の最適化
vLLM は、AMD Instinct MI355X 上での MiniMax M3 について、段階的なボトルネック駆動型の最適化プロセスを通じて、並行性 32 での MXFP8 出力トークン数/s/GPU を 109.1 から 342.4 まで大幅に向上させました。
vLLMの階層的KVキャッシュオフロード
vLLMは、解放されたキー・バリュー(KV)データをホストメモリ、ストレージ、およびリモートピアに保持する階層的KVキャッシュオフロードを導入し、再計算を回避し、レイテンシを削減し、サービング容量を向上させます。
vLLM GLM 5.3 最適化: ハイブリッド HiSparse オフロード
vLLM は GLM 5.3 用にハイブリッド HiSparse オフロードを導入し、メモリ圧力時に KV キャッシュを CPU メモリに動的にオフロードすることで、単一の 8x H200 ノード上で最大 100 万トークンのコンテキスト長を実現し、並行性を向上させます。
vLLM AgentXリリース:現実世界のエージェントサービングを最適化する
vLLMは、KVキャッシュ、並列化、スケジューリングの最適化を統合し、DeepSeek V4 Pro、MiniMax M3、Kimi K3などのエージェントワークロードにおいて、1GPU秒あたり最大13万トークンの性能と、Opus 5と比較して14.6倍~106倍のコスト優位性を達成しました。
vLLM TT プラグインが Tenstorrent アクセラレータを LLM サービングに導入
vLLM TT プラグインは、フェーズベーススケジューラ、デバイス内サンプリング、およびプロセス内ラン データ並列を用いて、Tenstorrent メッシュハードウェア上で OpenAI 互換の LLM サービングを可能にします。
vLLM GLM 5.3 最適化: Hybrid HiSparse オフローディング
vLLM は GLM 5.3 用に Hybrid HiSparse オフローディングを導入し、8x H200 ノードのようなメモリ制約のあるハードウェア上で、100 万トークンのフルコンテキスト長とより高い並列実行を可能にします。
vLLM-OmniによるMiniMax H3 FastH3のリアルタイムサービング
vLLM-OmniはFastVideoのFastH3スチューデントモデルを統合し、再生よりも速く完全なMiniMax H3のビデオ・音声MP4を生成し、8つのGPUを搭載したB300システムでリアルタイムのレイテンシを実現します。
vLLMのAMD GPUにおける推測的デコード:パフォーマンスと手法
vLLMはAMD Instinct MI300X/MI355X GPUに推測的デコードを導入し、軽量なドラフトモデルが複数のトークンを提案し、ターゲットモデルが1回の順伝播で検証する仕組みを可能にします。これにより、ドラフト手法、モデルファミリー、提案長に応じて出力トークンスループットが2倍以上に向上します。
vLLM Ray Direct Transport による大規模シャード化された重みの転送
vLLM は、Ray Direct Transport (RDT) を使用したシャード化された重み転送エンジンを導入し、オンライン RL 設定における兆単位のパラメータを持つモデルの効率的で障害耐性のある重み同期を可能にします。
IsoExec: SkyRLにおけるトレーナーと推論のミスマッチを解消する
vLLMは、実行契約と並列性不変カーネルを通じて、RLワークロードにおけるトレーニングエンジンと推論エンジンの間の数値的なミスマッチを解消する、統合実行抽象化であるIsoExecを導入しました。
VeRL-Omni v0.2.0 release notes / what's new
VeRL-Omni v0.2.0は、diffusion RLの高速化のためのrequest-level batchingと、安定したマルチモーダル自己回帰トレーニングのための再利用可能なオムニトレーニングスタックを導入しています。
vLLM-Omni 分散レイヤーワイズオフロード
vLLM-Omniは、重みシャーディングとダブルバッファドプリフェッチを活用してHBMおよびホストメモリ使用量を最適化することで、200Bパラメータを超える大規模なDiffusion Transformer(DiT)モデルを効率的に提供する分散レイヤーワイズオフロード(DLO)を導入しています。
DSparkを用いたvLLMの適応型検証
vLLMは、DSparkの信頼度ヘッドを使用して、ステップごとに検証される投機トークン数を動的に調整し、さまざまな並列度において高いスループットを維持する適応型検証を導入しました。
vLLM Day 0 Support for Qwen3.8-2.4T-A95B
vLLMは、Qwen-Maxクラスの機能をオープンウェイトで提供する2.4兆パラメータの疎なMoEモデル、Qwen3.8-2.4T-A95BのDay-0サポートを発表しました。
vLLMにおけるNVIDIA Nemotron 3.5 LightningのDay-0サポート
NVIDIAは、30BのNemotron 3.5 Lightningモデルに対するDay-0のvLLMサポートをリリースしました。ハイブリッドMoEアーキテクチャと3つの投機的デコーディング技術により、高速で常時稼働可能なエージェント推論を可能にします。
vLLM Decode Context Parallelism for Long Context Workloads
vLLMは、KVキャッシュをシーケンス次元でGPU間に分割するDecode Context Parallelism (DCP) を導入し、長文コンテキストのエージェント的ワークロードにおける同時実行数とスループットを大幅に向上させます。
vLLM Qwen3.5 パフォーマンス最適化
vLLMは、Blackwell向けに最適化されたカーネル、ハイブリッド・キャッシュ状態転送、および非同期スケジューリングを通じて、GB200 NVL72システム上のQwen3.5において、GPUあたり25,000トークン/秒(TPS)を超える合計スループットを達成しました。
vLLM Arm CPU向け最適化
vLLMは、Arm Neoverseベースのサーバー向けにフルスタックの最適化を実装し、メモリ割り当て、同期、量子化の改善によりスループットを最大6.2倍向上させました。
vLLM Speculators: 並列ドラフティングによるスペキュラティブデコーディング
vLLM と Speculators プロジェクトは、P-EAGLE、DFlash、DSpark のオープンソース サポートを導入し、自己回帰ドラフティングを超えて並列で候補トークン ブロックを生成し、LLM の推論を高速化します。
vLLM Kimi K3 サポート
vLLM は、2.8兆パラメータのマルチモーダル MoE モデルである Kimi K3 に対する day-0 サポートをリリースしました。Kimi Delta Attention と DSpark speculative decoding の最適化により、最大 370 tok/s を達成しています。
vLLM AFD Plugin: MoE サービングのための Attention と FFN の分離
vLLM AFD Plugin は Attention-FFN Disaggregation (AFD) を導入し、Mixture-of-Experts (MoE) モデルの Attention パスと FFN パスを独立してスケーリングおよび実行できるようにすることで、サービングのスループットとレイテンシを最適化します。
vLLMによるNVIDIA B300 GPU上でのGLM-5.2のサービング
vLLMは、P/D disaggregation、speculative padding、およびIndexerCacheの最適化を実装することにより、24枚のNVIDIA B300 GPU上でGLM-5.2-NVFP4のプロダクションSLA遵守を実現しました。
vLLM Kimi K3 サポートプレビュー
vLLMは、ハイブリッドKDA/フルアテンションアーキテクチャとネイティブビジョンサポートを特徴とする2.8兆パラメーターモデルであるMoonshot AIのKimi K3に対するday-0オープンソースサービングサポートの準備を進めています。
単一モデルを超えて:vLLM Semantic Router で Mixture-of-Models システムを構築
vLLM Semantic Router は、単一のモデルインターフェースを通じて複数の独立したモデルを調整する Mixture-of-Models システムの構築、バージョン管理、およびデプロイを可能にします。
vLLM Production Quality: CI, Benchmarking, and Release Process Overview
vLLMは、継続的インテグレーション、パフォーマンス・ベンチマーク、および厳格なリリースプロセスからなる3層の品質保証フレームワークを利用して、膨大な種類のハードウェアとモデルアーキテクチャにわたる安定性を維持しています。
vLLM TML Inkling サポート
vLLM は、1T パラメータのマルチモーダルモデルである TML Inkling の Day-0 サポートを発表しました。専門的なアーキテクチャ最適化により、4 つの GB200 GPU で最大 380 tok/s/user のスループットを実現します。
vLLM と TileRT のレイテンシクリティカルなサービング統合
vLLM は TileRT 0.1.5 をプラガブルなデコードエンジンとして統合し、レイテンシクリティカルなワークロードに対してネイティブなユーザーごとのデコード速度を提供しつつ、vLLM の標準的なプリフィルおよびサービングインフラストラクチャを維持します。
EAGLE-3 スペキュラティブ デコーディング on AMD Instinct GPUs
vLLM と AMD Quark は、AMD Instinct GPU 上で EAGLE-3 スペキュラティブ デコーディングのエンドツーエンド パイプラインを実装し、Kimi-K2.5 に対して最大 2.00x、MiniMax-M2.5 に対して最大 1.79x のスループット向上を達成しました。
vime の AMD Instinct GPU 向け ROCm サポート
vLLM は vime の ROCm サポートを発表し、AMD Instinct MI300X および MI355X GPU 上でエンドツーエンドの強化学習ポストトレーニングワークフローをネイティブに実行できるようにしました。
vLLM × HPC-Ops: 高性能 Attention と MoE バックエンド、Tencent Hunyuan から
vLLM は現在、NVIDIA Hopper H20 に最適化された HPC-Ops Attention および MoE バックエンドを含んでおり、Attention の速度向上は最大 2.95×、MoE の速度向上は 1.59× を実現し、Hy3 において TTFT を約 24%、TPOT を約 17% 削減します。
vLLM-Omni による Qwen3-Omni-30B-A3B-Instruct サービングの最適化
vLLM-Omni は Qwen3-Omni-30B-A3B-Instruct を 3 ステージのパイプライン(Thinker、Talker、Code2Wav)を介してサービングし、ステージ分解、CUDA Graphs、非同期チャンクハンドオフ、非同期出力、ステージレプリカ、およびホットパスのクリーンアップを使用してスループットとレイテンシを向上させます。
vLLM Semantic Router: マイクロエージェント協調によるモデル性能の向上
vLLMは、Semantic Routerというサービングレイヤーのプリミティブを導入し、単一のモデルAPIコールをマイクロエージェントの有界な協調に変換し、複雑なベンチマークにおいてフロンティアモデルを上回る性能を達成します。
vLLM-Omni TTS 推論エンジニアリング
vLLM-Omni は、Qwen3-TTS、VoxCPM2、Higgs Audio V3、Fish Speech S2 Pro などのモデルに対して、レイテンシーとスループットのボトルネックを分離するモデル固有の最適化を適用することで TTS 推論をエンジニアリングし、オーディオスループットを大幅に向上させ、エンドツーエンドレイテンシーを削減しました。
vLLM Semantic Router Fusion プリミティブがプログラム可能なマルチモデルサービングを実現
vLLM は Semantic Router 用に Fusion プリミティブを導入し、プログラム可能なマルチモデルパネル、評価、合成を第一級のサービングパターンとして実現しました。
MiniMax M3 vLLM サポート:1M トークンマルチモーダル推論の Day-0 サービング
vLLM は MiniMax M3 モデルファミリーに対する Day-0 サポートをリリースし、MiniMax Sparse Attention (MSA) を使用した 1M トークンコンテキストとネイティブなマルチモーダル推論の効率的なサービングを可能にしました。
DiffusionGemma: vLLMでネイティブにサポートされた初のDiffusion LLM
vLLMは26Bパラメータの離散拡散言語モデルであるDiffusionGemmaを統合しました。これにより、逐次的な自己回帰デコーディングの代わりにトークンブロックを反復的にデノイズすることで、高スループットかつ低レイテンシな生成が可能になります。
vime RL フレームワーク リリース
vLLMは、MegatronトレーニングとvLLM推論を統合し、LLM強化学習のための安定かつ効率的なパイプラインを提供するオープンソースのRLポストトレーニングフレームワークであるvimeを発表しました。
vLLM Semantic Router v0.3 Themis リリースノート
vLLM Semantic Router v0.3 Themisは、Session-Aware Agentic Routing (SAAR)、標準的な設定コントラクト、およびAMD ROCmとIntel OpenVINOへの拡張されたハードウェアサポートを特徴とする、ステートフルなプロダクション・ルーティングを導入します。
NVIDIA Nemotron 3 Ultra Support on vLLM
vLLM は、ハイブリッド Transformer-Mamba MoE アーキテクチャを通じて長時間実行される自律エージェント ワークフローに最適化された 550B パラメータ モデルである NVIDIA Nemotron 3 Ultra の Day-0 サポートを発表しました。
高速かつ効率的 LLM 推論 with vLLM コース ローンチ
vLLMはDeepLearning.AIおよびRed Hatと協力し、無料の中級コース「Fast & Efficient LLM 推論 with vLLM」を立ち上げ、AIデプロイメントのフルライフサイクルを教える。
vLLM セッション認識エージェントルーティング (SAAR) リリース
vLLM は、ツールループやプロバイダー状態遷移中の安全でないモデル切り替えを防ぐことで、長時間範囲の LLM エージェントのセッション継続性を保ち、コストを削減するモデル選択ポリシーである Session-Aware Agentic Routing (SAAR) を導入します。
vLLM-Omni が AutoRound 量子化で推論を加速
vLLM-Omni は Intel の AutoRound 事後学習量子化を統合し、モデルサイズを最大 62% 短縮しつつ精度を維持し、Intel XPU と NVIDIA GPU での性能向上を実現する W4A16 量子化を可能にしました。
DGX Spark上のvLLM:アーキテクチャ、構成、ローカル評価
vLLMはNVIDIA DGX Spark向けに高性能なローカル推論エンドポイントを提供し、統合メモリアーキテクチャとOpenAI互換APIを用いてNemotron-3-Superのような大規模NVFP4モデルのデプロイを可能にします。
Speculators v0.5.0 リリースノート / 新機能
Speculators v0.5.0は、シングルパスドラフトトークン生成のためのDFlashアルゴリズムサポート、vLLMのネイティブ隠れ状態抽出を介したオンラインおよびオフライントレーニングの統合、およびドキュメントの更新を導入します。
vLLM セマンティックルーターのマルチモーダルルーティングとビジョンエンコーダの強化
vLLM はセマンティックルーター (VSR) にマルチモーダルルーティングを導入し、システムが視覚的証拠をリクエストレベルのポリシー決定における第一級シグナルとして使用できるようにしました。また、Rust/Candle と PyTorch パス間の重要な実装ドリフトを解消しています。
Laguna XS.2 推論の最適化: vLLM、Speculators、LLM Compressor を使用
Poolside と Red Hat AI は、vLLM 統合、DFlash スペキュラティブ デコーディング、LLM Compressor 量子化を使用して、Laguna XS.2 33B-A3B MoE モデルをエージェンティック コーディング タスク向けに最適化しました。