아카이브 · 연구소 11곳 · 디스패치 73건

연구소

매일 아침 십여 개의 공식 블로그를 돌아볼 필요가 없습니다. OpenAI, Anthropic, DeepMind 등의 일차 발표를 핵심만 뽑아서.

51

vLLM 네이티브 RL API 릴리스

vLLM은 훈련과 추론 사이의 가중치 전송을 표준화하고 대규모 DPEP 배포에서 교착 상태를 제거하기 위해 네이티브 가중치 동기화 API와 향상된 비동기 RL 지원을 도입했습니다.

52

EAGLE 3.1 릴리즈 노트: 추측 디코딩 견고성 및 효율성 향상

EAGLE 3.1은 어텐션 드리프트를 해결하기 위한 아키텍처 개선을 도입하여 장기 컨텍스트 작업에서 허용 길이를 두 배로 늘리고, vLLM 및 TorchSpec 통합을 통해 처리량을 크게 증가시킵니다.

53

vLLM x Novita AI: PegaFlow for Production-Grade External KV Cache

vLLM과 Novita AI가 외부 KV 캐시 서비스인 PegaFlow를 발표했습니다. 이 서비스는 KV 캐시를 vLLM 워커와 분리하여 시작 시간을 단축하고, 캐시 공유를 통한 처리량을 높이며, RDMA 기반의 노드 간 접근을 가능하게 합니다.

54

VeRL-Omni: Diffusion 및 Omni-Modality 모델을 위한 RL 학습 프레임워크

vLLM은 diffusion 및 omni-modality 아키텍처를 포함하여 멀티모달 생성 모델을 위해 특별히 설계된 범용 강화 학습 사후 학습 프레임워크인 VeRL-Omni의 프리릴리스를 발표했습니다.

55

vLLM Elastic Expert Parallelism

vLLM은 서버 재시작 없이 런타임에 Mixture-of-Experts (MoE) 배포의 워커 수를 늘리거나 줄일 수 있는 Elastic Expert Parallelism (Elastic EP)을 도입했습니다.

56

vLLM 성능 벤치마크: Artificial Analysis 리더보드 1위

vLLM은 DeepSeek V3.2, MiniMax-M2.5, 그리고 Qwen 3.5 397B에 대해 공격적인 커널 융합 및 추측 디코딩 최적화를 구현함으로써 Artificial Analysis 리더보드에서 최고 순위를 달성했습니다.

57

vLLM TurboQuant 연구: 정확도 및 성능 분석

vLLM이 수행한 포괄적인 연구에 따르면 KV-cache 양자화에 있어 FP8이 여전히 최고의 기본 옵션이며, TurboQuant 변형은 추가 메모리 용량을 위해 상당한 처리량 및 지연 시간을 희생합니다.

58

vLLM x Mooncake를 이용한 대규모 에이전틱 워크로드 서빙

vLLM은 Mooncake의 분산 KV cache 스토어를 통합하여 에이전틱 LLM 서빙 성능을 향상시켰으며, 실제 트레이스에서 3.8배 높은 처리량, 46배 낮은 TTFT, 8.6배 낮은 엔드 투 엔드 지연 시간을 달성하는 동시에 60 GB200 GPU까지 확장 가능함을 보여주었습니다.

59

vLLM에서 NVIDIA Nemotron 3 Nano Omni 지원

vLLM은 이제 NVIDIA Nemotron 3 Nano Omni를 지원합니다. 이 모델은 30B MoE 멀티모달 모델로, 비전, 오디오, 언어 추론을 하나의 루프로 통합하여 에이전트 AI를 구동하는 고효율 모델입니다.

60

vLLM DeepSeek V4 지원: 효율적인 장기 컨텍스트 어텐션

vLLM은 이제 DeepSeek V4-Pro와 V4-Flash를 지원하며, 컨텍스트 길이를 최대 백만 토큰까지 확장하고 KV 캐시 메모리를 크게 절감하는 새로운 어텐션 메커니즘을 구현했습니다.

61

vLLM FP8 KV-Cache 및 Attention 양자화 업데이트

vLLM은 Hopper 및 Blackwell 아키텍처 전반에서 베이스라인에 가까운 정확도를 유지하면서 디코딩 지연 시간과 메모리 사용량을 줄이기 위해 FP8 KV-cache 및 attention 양자화를 최적화했습니다.

62

vLLM v0.20.0 하이브리드 SSM 모델을 위한 분산 서빙 추가

vLLM v0.20.0은 하이브리드 SSM‑FA 모델을 위한 분산 프리필/디코드 서빙을 도입하여, 이중 디스크립터 뷰와 3‑디스크립터 Conv 상태 전송을 통해 효율적인 KV 전송을 가능하게 합니다.

63

vLLM Korea Meetup 2026 정리

서울에서 열린 vLLM Korea Meetup 2026은 vLLM이 통합 추론 인프라로 진화한 모습을 보여주었으며, 커뮤니티 성장, 하드웨어 통합 진전, 프로덕션 스택 기능, 그리고 오픈소스 및 엔터프라이즈 트랙 전반에 걸친 실제 배포 전략을 선보였습니다.

64

vLLM 프리필-디코드 분산 처리 with MORI-IO

vLLM은 AMD의 MORI-IO 커넥터를 사용하여 단일 노드 8-GPU MI300X 환경에서 프리필-디코드 분산 처리를 구현하고, 인터-토큰 지연(ITL) 스파이크를 제거함으로써 2.5배 높은 굿풋을 달성합니다.

65

Gemma 4 on vLLM: 고급 추론 및 멀티모달 기능

vLLM은 Gemma 4에 대한 Day 0 지원을 도입했습니다. Gemma 4는 Google의 오픈 모델 패밀리로, 고급 추론, 멀티모달 입력 및 TPUs, GPUs, XPUs에 걸친 광범위한 하드웨어 호환성을 특징으로 합니다.

66

vLLM 숨겨진 상태 추출 시스템

vLLM v0.18.0은 추측 디코딩 초안 모델 훈련을 위해 내부 모델 표현을 고성능으로 검색할 수 있는 네이티브 숨겨진 상태 추출 시스템을 도입합니다.

67

vLLM Model Runner V2 릴리스 노트 / 새로운 내용

vLLM은 모델 러너를 처음부터 재구현한 Model Runner V2 (MRV2)를 도입했으며, GPU 네이티브, 비동기 우선, 모듈식 아키텍처를 통해 처리량을 향상하고 지연 시간을 감소시킵니다.

68

P-EAGLE: vLLM에서 병렬 추측 디코딩

vLLM은 모든 초안 토큰을 단일 전방 패스로 생성하는 병렬 추측 디코딩 방법인 P-EAGLE을 도입했으며, NVIDIA B200 GPU에서 기존 EAGLE-3 대비 최대 1.69배의 속도 향상을 제공합니다.

69

vLLM에서 NVIDIA Nemotron 3 Super 지원

vLLM은 이제 120억 파라미터 하이브리드 MoE 모델인 NVIDIA Nemotron 3 Super를 지원합니다. 이 모델은 멀티 에이전트 AI에 최적화되어 100만 토큰 컨텍스트 윈도우와 높은 추론 효율성을 제공합니다.

70

vLLM Semantic Router v0.2 Athena 릴리스 노트 / 새로운 내용

vLLM Semantic Router v0.2 Athena는 재구성된 모델 스택, 실험적인 ClawOS 오케스트레이션 레이어, 그리고 고급 모델 선택 프리미티브를 도입하여 의미 기반 라우팅을 다중 에이전트 배포를 위한 전략적 시스템 뇌로 변환합니다.

71

vLLM Triton Attention Backend 심층 분석

vLLM은 단일 소스 코드 구현을 통해 NVIDIA, AMD, Intel GPU 전반에서 최첨단 성능을 달성하는 휴대 가능한 Triton 기반 어텐션 백엔드를 구현했습니다.

72

vLLM AMD ROCm 어텐션 백엔드 최적화

vLLM은 AMD ROCm용 최적화된 어텐션 백엔드를 도입하여 Instinct MI300X, MI325X, MI355X GPU에서 MHA는 최대 4.4배, MLA는 1.5배 높은 처리량을 제공합니다.

73

vLLM MoE 모델을 위한 Multi-LoRA 서빙

vLLM 버전 0.15.0은 Mixture of Experts (MoE) 모델을 위한 최적화된 Multi-LoRA 서빙을 도입하여, 여러 파인튜닝 어댑터가 단일 GPU를 공유함으로써 유휴 컴퓨팅 용량을 줄일 수 있게 합니다.