아카이브 · 연구소 11곳 · 디스패치 73건

연구소

매일 아침 십여 개의 공식 블로그를 돌아볼 필요가 없습니다. OpenAI, Anthropic, DeepMind 등의 일차 발표를 핵심만 뽑아서.

01

vLLM의 PyNvVideoCodec를 활용한 다중 GPU 비디오 캡션 스케일링

vLLM은 이제 PyNvVideoCodec를 통해 NVIDIA 하드웨어 비디오 디코딩을 지원하여, H100 GPU에서 다중 GPU 비디오 캡션 작업의 CPU 병목 현상을 제거하고 처리량을 2배 이상 증가시켰습니다.

02

vLLM Kimi-K3 DSpark 사전 해석 구현

vLLM는 2.8T 파라미터의 Kimi K3 모델에 대해 DSpark 사전 해석기를 구현하여 수학적 추론 상호작용성을 초당 110에서 435 토큰으로 증가시키고, 최대 3.5배 높은 출력 처리량을 제공했습니다.

03

vLLM 및 Novita AI, Kimi K2.x용 더 빠른 INT4 MoE 커널 출시: Chord

Novita AI는 공개된 Humming 커널 대비 최대 2.15× 빠른 INT4 양자화 Kimi K2.x 서빙을 가능하게 하는 W4A16 MoE CUDA 연산자인 Chord를 오픈소스로 공개했습니다.

04

Kimi K3 성능 최적화: vLLM에서의 성과

vLLM은 Kimi K3에 대해 스택 전체 최적화를 구현하여 최대 2.8배의 처리량 증가와 최대 85%의 Time to First Token (TTFT) 감소를 달성했습니다.

05

AMD Instinct MI355X에서 MiniMax M3 최적화

vLLM는 AMD Instinct MI355X에서 MiniMax M3의 스루풋을 크게 향상시켜 동시성 32에서 MXFP8 출력 토큰/초/GPU를 109.1에서 342.4로 증가시켰으며, 이는 체계적인 버전 기반 최적화 과정을 통해 달성되었습니다.

06

vLLM 계층적 KV 캐시 오프로딩

vLLM은 계층적 KV 캐시 오프로딩을 도입하여 제거된 키-값 데이터를 호스트 메모리, 스토리지, 원격 피어에 유지함으로써 재계산을 피하고 지연을 줄이며 서비스 용량을 증가시켰습니다.

07

vLLM GLM 5.3 최적화: 하이브리드 HiSparse 오프로딩

vLLM는 GLM 5.3에 대해 하이브리드 HiSparse 오프로딩을 도입하여, 메모리 압박 상황에서 KV 캐시를 CPU 메모리로 동적으로 오프로딩함으로써 단일 8x H200 노드에서 전체 100만 토큰 컨텍스트 길이를 지원하고 동시성을 높입니다.

08

vLLM AgentX 릴리스: 실제 워크로드 기반 에이전트 서빙 최적화

vLLM는 KV 캐시, 병렬 처리, 스케줄링 최적화를 통합하여 DeepSeek V4 Pro, MiniMax M3, Kimi K3와 같은 에이전트 워크로드에서 최대 13만 토큰/GPU-초 성능과 Opus 5 대비 14.6배~106배의 비용 우위를 달성했습니다.

09

vLLM TT 플러그인은 LLM 서빙에 Tenstorrent 가속기 도입

vLLM TT 플러그인은 단계 기반 스케줄러, 장치 내 샘플링, 프로세스 내 레인 데이터 병렬성을 사용하여 Tenstorrent 메시 하드웨어에서 OpenAI 호환 LLM 서빙을 가능하게 합니다.

10

vLLM GLM 5.3 최적화: Hybrid HiSparse Offloading

vLLM은 GLM 5.3를 위해 Hybrid HiSparse offloading을 도입하여, 8x H200 노드와 같은 메모리 제한 환경에서도 100만 토큰의 전체 컨텍스트 길이를 지원하고 더 높은 동시성을 가능하게 합니다.

11

MiniMax H3 vLLM-Omni를 활용한 FastH3 실시간 서빙

vLLM-Omni는 FastVideo의 FastH3 학생 모델을 통합하여 MiniMax H3 비디오-오디오 MP4를 재생 시간보다 빠르게 생성하며, 8GPU B300 시스템에서 실시간 지연을 달성했습니다.

12

vLLM의 AMD GPU에서의 사전 추론: 성능과 방법론

vLLM는 AMD Instinct MI300X/MI355X GPU에 사전 추론 기능을 추가하여, 가벼운 초안 모델이 여러 토큰을 제안하고 목표 모델이 한 번의 전방 계산으로 검증하도록 하여, 초안 방법, 모델 계열, 제안 길이에 따라 출력 토큰 처리량을 두 배 이상 향상시킬 수 있습니다.

13

vLLM Ray Direct Transport를 사용한 대규모 분할 가중치 전송

vLLM는 Ray Direct Transport(RDT)를 사용한 분할 가중치 전송 엔진을 도입하여 온라인 RL 환경에서 트리리언 파라미터 규모의 모델에 대해 효율적이고 장애 내성 있는 가중치 동기화를 가능하게 합니다.

14

IsoExec: SkyRL에서 트레이너-인퍼런스 불일치 제거하기

vLLM는 실행 계약과 병렬성에 영향을 받지 않는 커널을 통해 RL 워크로드에서 학습 및 인퍼런스 엔진 간 수치적 불일치를 제거하는 통합 실행 추상화인 IsoExec를 도입했습니다.

15

VeRL-Omni v0.2.0 release notes / what's new

VeRL-Omni v0.2.0는 더 빠른 diffusion RL을 위한 request-level batching과 안정적인 멀티모달 자기회귀 학습을 위한 재사용 가능한 omni training stack을 도입합니다.

16

vLLM-Omni 분산 계층별 오프로드

vLLM-Omni는 분산 계층별 오프로드(DLO)를 도입하여, 가중치 샤딩과 이중 버퍼 프리페치를 통해 HBM 및 호스트 메모리 사용을 최적화함으로써 200B 파라미터 이상의 대규모 Diffusion Transformer(DiT) 모델을 효율적으로 제공할 수 있게 합니다.

17

vLLM DSpark을 활용한 적응형 검증(Adaptive Verification)

vLLM은 DSpark의 신뢰도 헤드를 사용하여 단계별로 검증할 추측적 토큰의 수를 동적으로 조정함으로써, 다양한 동시성 수준에서 높은 처리량을 유지하는 적응형 검증을 도입합니다.

18

vLLM의 Qwen3.8-2.4T-A95B Day 0 지원

vLLM이 Qwen-Max급 성능을 오픈 웨이트로 제공하는 2.4조 파라미터 규모의 희소 MoE 모델인 Qwen3.8-2.4T-A95B에 대한 Day-0 지원을 발표했습니다.

19

NVIDIA Nemotron 3.5 Lightning vLLM Day-0 지원

NVIDIA는 30B Nemotron 3.5 Lightning 모델에 대한 Day-0 vLLM 지원을 출시하여, 하이브리드 MoE 아키텍처와 세 가지 추측적 디코딩 기술을 통해 빠르고 상시 가동되는 에이전트 추론을 가능하게 합니다.

20

vLLM Decode Context Parallelism for Long Context Workloads

vLLM은 KV 캐시를 시퀀스 차원을 따라 GPU 간에 샤딩하여, 긴 문맥의 에이전트형 워크로드에서 동시성과 처리량을 크게 향상시키는 Decode Context Parallelism (DCP)을 도입했습니다.

21

vLLM Qwen3.5 성능 최적화

vLLM은 Blackwell 최적화 커널, hybrid cache state 전송 및 async scheduling을 통해 GB200 NVL72 시스템에서 Qwen3.5에 대해 GPU당 25,000 tokens per second (TPS) 이상의 성능을 달성했습니다.

22

vLLM Arm CPU 최적화

vLLM은 Arm Neoverse 기반 서버를 위한 풀스택 최적화를 일련으로 구현하여 메모리 할당, 동기화, 양자화 개선을 통해 최대 6.2배 처리량 향상을 달성했습니다.

23

vLLM Speculators: 추측 디코딩을 위한 병렬 드래프팅

vLLM과 Speculators 프로젝트는 P-EAGLE, DFlash, DSpark에 대한 오픈소스 지원을 도입하여, 자기회귀 드래프팅을 넘어 병렬로 후보 토큰 블록을 생성함으로써 더 빠른 LLM 추론을 가능하게 합니다.

24

vLLM Kimi K3 지원

vLLM이 2.8조 파라미터 규모의 멀티모달 MoE 모델인 Kimi K3에 대한 day-0 지원을 출시했습니다. Kimi Delta Attention 및 DSpark speculative decoding 최적화를 통해 최대 370 tok/s의 성능을 구현했습니다.

25

vLLM AFD 플러그인: MoE 서빙을 위한 Attention과 FFN 분리

vLLM AFD 플러그인은 Attention-FFN 분리(AFD)를 도입하여 Mixture-of-Experts(MoE) 모델의 Attention과 FFN 경로가 독립적으로 규모를 조정하고 실행할 수 있게 하여 서빙 처리량과 지연 시간을 최적화합니다.

26

vLLM을 사용하여 NVIDIA B300 GPU에서 GLM-5.2 제공

vLLM은 P/D disaggregation, speculative padding, 그리고 IndexerCache 최적화를 구현하여 24개의 NVIDIA B300 GPU에서 GLM-5.2-NVFP4에 대한 프로덕션 SLA 준수를 달성했습니다.

27

vLLM Kimi K3 지원 미리보기

vLLM은 Moonshot AI의 Kimi K3에 대한 day-0 오픈소스 서빙 지원을 준비하고 있습니다. 이는 하이브리드 KDA/풀 어텐션 아키텍처와 네이티브 비전 지원을 갖춘 2.8조 파라미터 모델입니다.

28

단일 모델을 넘어: vLLM Semantic Router로 Mixture-of-Models 시스템 구축하기

vLLM Semantic Router는 이제 단일 모델 인터페이스를 통해 여러 독립 모델을 조정하는 Mixture-of-Models 시스템을 구축, 버전 관리, 배포할 수 있게 합니다.

29

vLLM Production Quality: CI, Benchmarking, and Release Process Overview

vLLM은 방대한 종류의 하드웨어와 모델 아키텍처 전반에 걸쳐 안정성을 유지하기 위해 지속적 통합, 성능 벤치마킹, 엄격한 릴리스 프로세스를 포함하는 3단계 품질 보증 프레임워크를 활용합니다.

30

vLLM TML Inkling 지원

vLLM은 1T-파라미터 멀티모달 모델인 TML Inkling에 대한 Day-0 지원을 발표했으며, 특수 아키텍처 최적화를 통해 4개의 GB200 GPU에서 사용자당 최대 380 tok/s를 제공합니다.

31

vLLM과 TileRT 통합으로 지연 민감한 서빙

vLLM은 지연 민감한 워크로드에 대한 네이티브 per-user 디코드 속도를 제공하기 위해 플러그 가능한 디코드 엔진으로 TileRT 0.1.5를 통합하면서 vLLM의 표준 프리필 및 서빙 인프라를 유지합니다.

32

EAGLE-3 추측 디코딩 on AMD Instinct GPUs

vLLM과 AMD Quark는 AMD Instinct GPU에서 EAGLE-3 추측 디코딩을 위한 엔드투엔드 파이프라인을 구현하여 Kimi-K2.5에 대해 최대 2.00x, MiniMax-M2.5에 대해 최대 1.79x의 처리량 속도 향상을 달성했습니다.

33

vime ROCm 지원 AMD Instinct GPU용

vLLM은 vime에 대한 ROCm 지원을 발표하여, AMD Instinct MI300X 및 MI355X GPU에서 엔드-투-엔드 강화 학습 pós-트레이닝 워크플로를 네이티브로 실행할 수 있게 했습니다.

34

vLLM × HPC-Ops: Tencent Hunyuan의 고성능 Attention 및 MoE 백엔드

vLLM에 NVIDIA Hopper H20에 최적화된 HPC-Ops attention 및 MoE 백엔드가 포함되었습니다. 이를 통해 attention 속도는 최대 2.95배, MoE 속도는 1.59배 향상되었으며, Hy3 모델에서 TTFT는 약 24%, TPOT는 약 17% 감소했습니다.

35

Qwen3-Omni-30B-A3B-Instruct 서빙을 위한 vLLM-Omni 최적화

vLLM-Omni는 Thinker, Talker, Code2Wav의 3단계 파이프라인을 통해 Qwen3-Omni-30B-A3B-Instruct를 서빙하며, 단계 분해, CUDA Graphs, async chunk handoffs, async output, stage replicas 및 hot-path cleanup을 사용하여 처리량과 지연 시간을 개선합니다.

36

vLLM Semantic Router: 마이크로 에이전트 협업을 통한 모델 성능 향상

vLLM은 Semantic Router를 도입했는데, 이는 서빙 레이어 프리미티브로서 단일 모델 API 호출을 마이크로 에이전트의 제한된 협업으로 변환하여 복잡한 벤치마크에서 프론티어 모델보다 우수한 성능을 내게 합니다.

37

vLLM-Omni TTS 추론 엔지니어링

vLLM-Omni는 Qwen3-TTS, VoxCPM2, Higgs Audio V3, Fish Speech S2 Pro와 같은 모델에 대해 모델별 최적화를 적용하여 지연 시간과 처리량 병목을 분리함으로써 TTS 추론을 엔지니어링했으며,これにより 오디오 처리량을 크게 향상시키고 엔드투엔드 지연 시간을 감소시켰습니다.

38

vLLM Semantic Router Fusion 프리미티브는 프로그래머블 멀티‑모델 서빙을 가능하게 합니다

vLLM은 Semantic Router용 Fusion 프리미티브를 도입하여, 프로그래머블 멀티‑모델 패널, 판정 및 합성을 일급 서빙 패턴으로 구현했습니다.

39

MiniMax M3 vLLM 지원: 1M-토큰 멀티모달 추론을 위한 Day-0 서빙

vLLM은 MiniMax M3 모델 패밀리에 대한 day-0 지원을 출시했으며, MiniMax Sparse Attention (MSA)를 사용해 1M-토큰 컨텍스트와 네이티브 멀티모달 추론을 효율적으로 서빙할 수 있게 되었습니다.

40

DiffusionGemma: vLLM에서 네이티브로 처음 지원되는 첫 번째 Diffusion LLM

vLLM은 26B 파라미터 이산 디퓨전 언어 모델인 DiffusionGemma를 통합하여, 순차적 자동 회귀 디코딩 대신 토큰 블록을 반복적으로 디노이즈함으로써 높은 처리량과 낮은 지연 시간을 달성합니다.

41

vime RL 프레임워크 출시

vLLM은 오픈소스 RL pós트레이닝 프레임워크인 vime를 소개합니다. 이는 Megatron 훈련과 vLLM 추론을 통합하여 LLM 강화 학습을 위한 안정적이고 효율적인 파이프라인을 제공합니다.

42

vLLM Semantic Router v0.3 Themis 릴리스 노트

vLLM Semantic Router v0.3 Themis는 상태 저장 프로덕션 라우팅을 도입하며, 세션 인식 에이전트 라우팅 (SAAR), 표준 구성 계약, 그리고 AMD ROCm 및 Intel OpenVINO에 대한 확장된 하드웨어 지원을 특징으로 합니다.

43

vLLM에서의 NVIDIA Nemotron 3 Ultra 지원

vLLM이 하이브리드 Transformer-Mamba MoE 아키텍처를 통해 장기 실행 자율 에이전트 워크플로우에 최적화된 550B 파라미터 모델인 NVIDIA Nemotron 3 Ultra에 대한 Day-0 지원을 발표했습니다.

44

vLLM을 활용한 빠르고 효율적인 LLM 추론 코스 출시

vLLM이 DeepLearning.AI 및 Red Hat과 협력하여 전체 AI 배포 라이프사이클을 교육하기 위한 무료 중급 코스인 "Fast & Efficient LLM Inference with vLLM"을 출시했습니다.

45

vLLM Session-Aware Agentic Routing (SAAR) 출시

vLLM은 세션 연속성을 유지하고 도구 루프 및 제공자 상태 전환 중 안전하지 않은 모델 전환을 방지함으로써 장기 호리즌 LLM 에이전트의 비용을 줄이는 모델 선택 정책인 Session-Aware Agentic Routing (SAAR)를 도입합니다.

46

vLLM-Omni는 AutoRound 양자화로 추론을 가속화합니다

vLLM-Omni는 이제 Intel의 AutoRound 포스트 트레이닝 양자화를 통합하여, W4A16 양자화를 통해 모델 크기를 최대 62% 줄이면서 정확도를 유지하고 Intel XPU 및 NVIDIA GPU에서 성능 향상을 잠금 해제합니다.

47

DGX Spark에서 vLLM: 아키텍처, 구성 및 로컬 평가

vLLM은 NVIDIA DGX Spark를 위한 고성능 로컬 추론 엔드포인트를 제공하여, 통합 메모리 아키텍처와 OpenAI 호환 API를 사용해 Nemotron-3-Super와 같은 대형 NVFP4 모델을 배포할 수 있게 합니다.

48

Speculators v0.5.0 릴리스 노트 / 새로운 기능

Speculators v0.5.0은 단일 패스 드래프트 토큰 생성을 위한 DFlash 알고리즘 지원, vLLM의 네이티브 히든 스테이트 추출을 통한 온라인 및 오프라인 학습 통합, 그리고 업데이트된 문서를 도입합니다.

49

vLLM Semantic Router 멀티모달 라우팅 및 비전 인코더 강화

vLLM은 Semantic Router (VSR)에 멀티모달 라우팅을 도입하여, Rust/Candle와 PyTorch 경로 간의 심각한 구현 드리프트를 해결하는 동시에 시각적 증거를 요청 수준 정책 결정을 위한 일급 신호로 사용할 수 있도록 했습니다.

50

vLLM, Speculators, 및 LLM Compressor를 사용한 Laguna XS.2 추론 최적화

Poolside와 Red Hat AI는 vLLM 통합, DFlash 추측 디코딩, 및 LLM Compressor 양자화를 사용하여 에이전트 코딩 작업을 위한 Laguna XS.2 33B-A3B MoE 모델을 최적화했습니다.