01

vLLM Arm CPU 최적화

vLLM은 Arm Neoverse 기반 서버를 위한 풀스택 최적화를 일련으로 구현하여 메모리 할당, 동기화, 양자화 개선을 통해 최대 6.2배 처리량 향상을 달성했습니다.

02

vLLM Speculators: 추측 디코딩을 위한 병렬 드래프팅

vLLM과 Speculators 프로젝트는 P-EAGLE, DFlash, DSpark에 대한 오픈소스 지원을 도입하여, 자기회귀 드래프팅을 넘어 병렬로 후보 토큰 블록을 생성함으로써 더 빠른 LLM 추론을 가능하게 합니다.

03

vLLM Kimi K3 지원

vLLM이 2.8조 파라미터 규모의 멀티모달 MoE 모델인 Kimi K3에 대한 day-0 지원을 출시했습니다. Kimi Delta Attention 및 DSpark speculative decoding 최적화를 통해 최대 370 tok/s의 성능을 구현했습니다.

04

vLLM AFD 플러그인: MoE 서빙을 위한 Attention과 FFN 분리

vLLM AFD 플러그인은 Attention-FFN 분리(AFD)를 도입하여 Mixture-of-Experts(MoE) 모델의 Attention과 FFN 경로가 독립적으로 규모를 조정하고 실행할 수 있게 하여 서빙 처리량과 지연 시간을 최적화합니다.

05

vLLM을 사용하여 NVIDIA B300 GPU에서 GLM-5.2 제공

vLLM은 P/D disaggregation, speculative padding, 그리고 IndexerCache 최적화를 구현하여 24개의 NVIDIA B300 GPU에서 GLM-5.2-NVFP4에 대한 프로덕션 SLA 준수를 달성했습니다.

06

vLLM Kimi K3 지원 미리보기

vLLM은 Moonshot AI의 Kimi K3에 대한 day-0 오픈소스 서빙 지원을 준비하고 있습니다. 이는 하이브리드 KDA/풀 어텐션 아키텍처와 네이티브 비전 지원을 갖춘 2.8조 파라미터 모델입니다.

07

단일 모델을 넘어: vLLM Semantic Router로 Mixture-of-Models 시스템 구축하기

vLLM Semantic Router는 이제 단일 모델 인터페이스를 통해 여러 독립 모델을 조정하는 Mixture-of-Models 시스템을 구축, 버전 관리, 배포할 수 있게 합니다.

08

vLLM Production Quality: CI, Benchmarking, and Release Process Overview

vLLM은 방대한 종류의 하드웨어와 모델 아키텍처 전반에 걸쳐 안정성을 유지하기 위해 지속적 통합, 성능 벤치마킹, 엄격한 릴리스 프로세스를 포함하는 3단계 품질 보증 프레임워크를 활용합니다.

09

vLLM TML Inkling 지원

vLLM은 1T-파라미터 멀티모달 모델인 TML Inkling에 대한 Day-0 지원을 발표했으며, 특수 아키텍처 최적화를 통해 4개의 GB200 GPU에서 사용자당 최대 380 tok/s를 제공합니다.

10

vLLM과 TileRT 통합으로 지연 민감한 서빙

vLLM은 지연 민감한 워크로드에 대한 네이티브 per-user 디코드 속도를 제공하기 위해 플러그 가능한 디코드 엔진으로 TileRT 0.1.5를 통합하면서 vLLM의 표준 프리필 및 서빙 인프라를 유지합니다.

11

EAGLE-3 추측 디코딩 on AMD Instinct GPUs

vLLM과 AMD Quark는 AMD Instinct GPU에서 EAGLE-3 추측 디코딩을 위한 엔드투엔드 파이프라인을 구현하여 Kimi-K2.5에 대해 최대 2.00x, MiniMax-M2.5에 대해 최대 1.79x의 처리량 속도 향상을 달성했습니다.

12

vime ROCm 지원 AMD Instinct GPU용

vLLM은 vime에 대한 ROCm 지원을 발표하여, AMD Instinct MI300X 및 MI355X GPU에서 엔드-투-엔드 강화 학습 pós-트레이닝 워크플로를 네이티브로 실행할 수 있게 했습니다.

13

vLLM × HPC-Ops: Tencent Hunyuan의 고성능 Attention 및 MoE 백엔드

vLLM에 NVIDIA Hopper H20에 최적화된 HPC-Ops attention 및 MoE 백엔드가 포함되었습니다. 이를 통해 attention 속도는 최대 2.95배, MoE 속도는 1.59배 향상되었으며, Hy3 모델에서 TTFT는 약 24%, TPOT는 약 17% 감소했습니다.

14

Qwen3-Omni-30B-A3B-Instruct 서빙을 위한 vLLM-Omni 최적화

vLLM-Omni는 Thinker, Talker, Code2Wav의 3단계 파이프라인을 통해 Qwen3-Omni-30B-A3B-Instruct를 서빙하며, 단계 분해, CUDA Graphs, async chunk handoffs, async output, stage replicas 및 hot-path cleanup을 사용하여 처리량과 지연 시간을 개선합니다.

15

vLLM Semantic Router: 마이크로 에이전트 협업을 통한 모델 성능 향상

vLLM은 Semantic Router를 도입했는데, 이는 서빙 레이어 프리미티브로서 단일 모델 API 호출을 마이크로 에이전트의 제한된 협업으로 변환하여 복잡한 벤치마크에서 프론티어 모델보다 우수한 성능을 내게 합니다.

16

vLLM-Omni TTS 추론 엔지니어링

vLLM-Omni는 Qwen3-TTS, VoxCPM2, Higgs Audio V3, Fish Speech S2 Pro와 같은 모델에 대해 모델별 최적화를 적용하여 지연 시간과 처리량 병목을 분리함으로써 TTS 추론을 엔지니어링했으며,これにより 오디오 처리량을 크게 향상시키고 엔드투엔드 지연 시간을 감소시켰습니다.

17

vLLM Semantic Router Fusion 프리미티브는 프로그래머블 멀티‑모델 서빙을 가능하게 합니다

vLLM은 Semantic Router용 Fusion 프리미티브를 도입하여, 프로그래머블 멀티‑모델 패널, 판정 및 합성을 일급 서빙 패턴으로 구현했습니다.

18

MiniMax M3 vLLM 지원: 1M-토큰 멀티모달 추론을 위한 Day-0 서빙

vLLM은 MiniMax M3 모델 패밀리에 대한 day-0 지원을 출시했으며, MiniMax Sparse Attention (MSA)를 사용해 1M-토큰 컨텍스트와 네이티브 멀티모달 추론을 효율적으로 서빙할 수 있게 되었습니다.

19

DiffusionGemma: vLLM에서 네이티브로 처음 지원되는 첫 번째 Diffusion LLM

vLLM은 26B 파라미터 이산 디퓨전 언어 모델인 DiffusionGemma를 통합하여, 순차적 자동 회귀 디코딩 대신 토큰 블록을 반복적으로 디노이즈함으로써 높은 처리량과 낮은 지연 시간을 달성합니다.

20

vime RL 프레임워크 출시

vLLM은 오픈소스 RL pós트레이닝 프레임워크인 vime를 소개합니다. 이는 Megatron 훈련과 vLLM 추론을 통합하여 LLM 강화 학습을 위한 안정적이고 효율적인 파이프라인을 제공합니다.

21

vLLM Semantic Router v0.3 Themis 릴리스 노트

vLLM Semantic Router v0.3 Themis는 상태 저장 프로덕션 라우팅을 도입하며, 세션 인식 에이전트 라우팅 (SAAR), 표준 구성 계약, 그리고 AMD ROCm 및 Intel OpenVINO에 대한 확장된 하드웨어 지원을 특징으로 합니다.

22

vLLM에서의 NVIDIA Nemotron 3 Ultra 지원

vLLM이 하이브리드 Transformer-Mamba MoE 아키텍처를 통해 장기 실행 자율 에이전트 워크플로우에 최적화된 550B 파라미터 모델인 NVIDIA Nemotron 3 Ultra에 대한 Day-0 지원을 발표했습니다.

23

vLLM을 활용한 빠르고 효율적인 LLM 추론 코스 출시

vLLM이 DeepLearning.AI 및 Red Hat과 협력하여 전체 AI 배포 라이프사이클을 교육하기 위한 무료 중급 코스인 "Fast & Efficient LLM Inference with vLLM"을 출시했습니다.

24

vLLM Session-Aware Agentic Routing (SAAR) 출시

vLLM은 세션 연속성을 유지하고 도구 루프 및 제공자 상태 전환 중 안전하지 않은 모델 전환을 방지함으로써 장기 호리즌 LLM 에이전트의 비용을 줄이는 모델 선택 정책인 Session-Aware Agentic Routing (SAAR)를 도입합니다.

25

vLLM-Omni는 AutoRound 양자화로 추론을 가속화합니다

vLLM-Omni는 이제 Intel의 AutoRound 포스트 트레이닝 양자화를 통합하여, W4A16 양자화를 통해 모델 크기를 최대 62% 줄이면서 정확도를 유지하고 Intel XPU 및 NVIDIA GPU에서 성능 향상을 잠금 해제합니다.

26

DGX Spark에서 vLLM: 아키텍처, 구성 및 로컬 평가

vLLM은 NVIDIA DGX Spark를 위한 고성능 로컬 추론 엔드포인트를 제공하여, 통합 메모리 아키텍처와 OpenAI 호환 API를 사용해 Nemotron-3-Super와 같은 대형 NVFP4 모델을 배포할 수 있게 합니다.

27

vLLM, Speculators, 및 LLM Compressor를 사용한 Laguna XS.2 추론 최적화

Poolside와 Red Hat AI는 vLLM 통합, DFlash 추측 디코딩, 및 LLM Compressor 양자화를 사용하여 에이전트 코딩 작업을 위한 Laguna XS.2 33B-A3B MoE 모델을 최적화했습니다.

28

vLLM Semantic Router 멀티모달 라우팅 및 비전 인코더 강화

vLLM은 Semantic Router (VSR)에 멀티모달 라우팅을 도입하여, Rust/Candle와 PyTorch 경로 간의 심각한 구현 드리프트를 해결하는 동시에 시각적 증거를 요청 수준 정책 결정을 위한 일급 신호로 사용할 수 있도록 했습니다.

29

Speculators v0.5.0 릴리스 노트 / 새로운 기능

Speculators v0.5.0은 단일 패스 드래프트 토큰 생성을 위한 DFlash 알고리즘 지원, vLLM의 네이티브 히든 스테이트 추출을 통한 온라인 및 오프라인 학습 통합, 그리고 업데이트된 문서를 도입합니다.

30

vLLM 네이티브 RL API 릴리스

vLLM은 훈련과 추론 사이의 가중치 전송을 표준화하고 대규모 DPEP 배포에서 교착 상태를 제거하기 위해 네이티브 가중치 동기화 API와 향상된 비동기 RL 지원을 도입했습니다.

31

EAGLE 3.1 릴리즈 노트: 추측 디코딩 견고성 및 효율성 향상

EAGLE 3.1은 어텐션 드리프트를 해결하기 위한 아키텍처 개선을 도입하여 장기 컨텍스트 작업에서 허용 길이를 두 배로 늘리고, vLLM 및 TorchSpec 통합을 통해 처리량을 크게 증가시킵니다.

32

vLLM x Novita AI: PegaFlow for Production-Grade External KV Cache

vLLM과 Novita AI가 외부 KV 캐시 서비스인 PegaFlow를 발표했습니다. 이 서비스는 KV 캐시를 vLLM 워커와 분리하여 시작 시간을 단축하고, 캐시 공유를 통한 처리량을 높이며, RDMA 기반의 노드 간 접근을 가능하게 합니다.

33

VeRL-Omni: Diffusion 및 Omni-Modality 모델을 위한 RL 학습 프레임워크

vLLM은 diffusion 및 omni-modality 아키텍처를 포함하여 멀티모달 생성 모델을 위해 특별히 설계된 범용 강화 학습 사후 학습 프레임워크인 VeRL-Omni의 프리릴리스를 발표했습니다.

34

vLLM Elastic Expert Parallelism

vLLM은 서버 재시작 없이 런타임에 Mixture-of-Experts (MoE) 배포의 워커 수를 늘리거나 줄일 수 있는 Elastic Expert Parallelism (Elastic EP)을 도입했습니다.

35

vLLM 성능 벤치마크: Artificial Analysis 리더보드 1위

vLLM은 DeepSeek V3.2, MiniMax-M2.5, 그리고 Qwen 3.5 397B에 대해 공격적인 커널 융합 및 추측 디코딩 최적화를 구현함으로써 Artificial Analysis 리더보드에서 최고 순위를 달성했습니다.

36

vLLM TurboQuant 연구: 정확도 및 성능 분석

vLLM이 수행한 포괄적인 연구에 따르면 KV-cache 양자화에 있어 FP8이 여전히 최고의 기본 옵션이며, TurboQuant 변형은 추가 메모리 용량을 위해 상당한 처리량 및 지연 시간을 희생합니다.

37

vLLM x Mooncake를 이용한 대규모 에이전틱 워크로드 서빙

vLLM은 Mooncake의 분산 KV cache 스토어를 통합하여 에이전틱 LLM 서빙 성능을 향상시켰으며, 실제 트레이스에서 3.8배 높은 처리량, 46배 낮은 TTFT, 8.6배 낮은 엔드 투 엔드 지연 시간을 달성하는 동시에 60 GB200 GPU까지 확장 가능함을 보여주었습니다.

38

vLLM에서 NVIDIA Nemotron 3 Nano Omni 지원

vLLM은 이제 NVIDIA Nemotron 3 Nano Omni를 지원합니다. 이 모델은 30B MoE 멀티모달 모델로, 비전, 오디오, 언어 추론을 하나의 루프로 통합하여 에이전트 AI를 구동하는 고효율 모델입니다.

39

vLLM DeepSeek V4 지원: 효율적인 장기 컨텍스트 어텐션

vLLM은 이제 DeepSeek V4-Pro와 V4-Flash를 지원하며, 컨텍스트 길이를 최대 백만 토큰까지 확장하고 KV 캐시 메모리를 크게 절감하는 새로운 어텐션 메커니즘을 구현했습니다.

40

vLLM FP8 KV-Cache 및 Attention 양자화 업데이트

vLLM은 Hopper 및 Blackwell 아키텍처 전반에서 베이스라인에 가까운 정확도를 유지하면서 디코딩 지연 시간과 메모리 사용량을 줄이기 위해 FP8 KV-cache 및 attention 양자화를 최적화했습니다.

41

vLLM v0.20.0 하이브리드 SSM 모델을 위한 분산 서빙 추가

vLLM v0.20.0은 하이브리드 SSM‑FA 모델을 위한 분산 프리필/디코드 서빙을 도입하여, 이중 디스크립터 뷰와 3‑디스크립터 Conv 상태 전송을 통해 효율적인 KV 전송을 가능하게 합니다.

42

vLLM Korea Meetup 2026 정리

서울에서 열린 vLLM Korea Meetup 2026은 vLLM이 통합 추론 인프라로 진화한 모습을 보여주었으며, 커뮤니티 성장, 하드웨어 통합 진전, 프로덕션 스택 기능, 그리고 오픈소스 및 엔터프라이즈 트랙 전반에 걸친 실제 배포 전략을 선보였습니다.

43

vLLM 프리필-디코드 분산 처리 with MORI-IO

vLLM은 AMD의 MORI-IO 커넥터를 사용하여 단일 노드 8-GPU MI300X 환경에서 프리필-디코드 분산 처리를 구현하고, 인터-토큰 지연(ITL) 스파이크를 제거함으로써 2.5배 높은 굿풋을 달성합니다.

44

Gemma 4 on vLLM: 고급 추론 및 멀티모달 기능

vLLM은 Gemma 4에 대한 Day 0 지원을 도입했습니다. Gemma 4는 Google의 오픈 모델 패밀리로, 고급 추론, 멀티모달 입력 및 TPUs, GPUs, XPUs에 걸친 광범위한 하드웨어 호환성을 특징으로 합니다.

45

vLLM 숨겨진 상태 추출 시스템

vLLM v0.18.0은 추측 디코딩 초안 모델 훈련을 위해 내부 모델 표현을 고성능으로 검색할 수 있는 네이티브 숨겨진 상태 추출 시스템을 도입합니다.

46

vLLM Model Runner V2 릴리스 노트 / 새로운 내용

vLLM은 모델 러너를 처음부터 재구현한 Model Runner V2 (MRV2)를 도입했으며, GPU 네이티브, 비동기 우선, 모듈식 아키텍처를 통해 처리량을 향상하고 지연 시간을 감소시킵니다.

47

P-EAGLE: vLLM에서 병렬 추측 디코딩

vLLM은 모든 초안 토큰을 단일 전방 패스로 생성하는 병렬 추측 디코딩 방법인 P-EAGLE을 도입했으며, NVIDIA B200 GPU에서 기존 EAGLE-3 대비 최대 1.69배의 속도 향상을 제공합니다.

48

vLLM에서 NVIDIA Nemotron 3 Super 지원

vLLM은 이제 120억 파라미터 하이브리드 MoE 모델인 NVIDIA Nemotron 3 Super를 지원합니다. 이 모델은 멀티 에이전트 AI에 최적화되어 100만 토큰 컨텍스트 윈도우와 높은 추론 효율성을 제공합니다.

49

vLLM Semantic Router v0.2 Athena 릴리스 노트 / 새로운 내용

vLLM Semantic Router v0.2 Athena는 재구성된 모델 스택, 실험적인 ClawOS 오케스트레이션 레이어, 그리고 고급 모델 선택 프리미티브를 도입하여 의미 기반 라우팅을 다중 에이전트 배포를 위한 전략적 시스템 뇌로 변환합니다.

50

vLLM Triton Attention Backend 심층 분석

vLLM은 단일 소스 코드 구현을 통해 NVIDIA, AMD, Intel GPU 전반에서 최첨단 성능을 달성하는 휴대 가능한 Triton 기반 어텐션 백엔드를 구현했습니다.