vLLM Korea Meetup 2026 정리
TL;DR
vLLM Korea Meetup 2026은 2026년 4월 2일 서울에서 개최되어, vLLM이 다양한 하드웨어와 환경에서 LLM serving의 공통 레이어가 되고 있음을 보여주었으며, v1 아키텍처 업데이트, vllm‑playground 같은 새로운 도구, 액셀러레이터 통합 로드맵, 프로덕션 스택 향상, 메모리 최적화, 엔터프라이즈 보안, 멀티모달 serving의詳細 사례 등을 선보였습니다.
Community Growth and Governance
미팅은 Rebellions, SqueezeBits, Red Hat APAC, PyTorch Korea의 지원을 받아 vLLM KR Community가 주최했습니다. 참석률이 높았고, 사후 설문 조사에서 약 75 %의 응답률을 달성하여 높은 참여도를 나타냈습니다. 전체 만족도가 높게 보고되어, 이 행사가 심도 있는 실용적 내용과 진정한 커뮤니티 경험을 모두 제공했음을 확인했습니다.
Rebellions의 Dr. Hongseok Kim은 inaugural meetup 이후 vLLM KR 커뮤니티가 구축한 운영 구조를 설명했습니다: 정기적인 미팅과 실습 워크샵을 지원하는 Steering Group‑중심 거버넌스 모델입니다.
Technical Evolution: v0 to v1 Migration
Dr. Kim은 vLLM이 v0에서 v1로 완전한 아키텍처 마이그레이션을 강조했는데, 이는 코드베이스를 간소화하고 모듈성을 강화합니다. 내부 변경 사항에는 비동기 스케줄링과 Model Runner 개선이 포함됩니다. 이 마이그레이션은 스트리밍 API, 시맨틱 라우터, vLLM‑Omni와 같은 빠른 기능 확장을 동반했습니다.
Lowering the Barrier to Entry
Red Hat APAC의 Li Ming은 vLLM의 infamous한 높은 진입 장벽(140+ 구성 매개변수)을 줄이기 위해 설계된 GUI 기반 도구인 vllm‑playground를 소개했습니다. 이 도구는 첫 실행까지의 시간을 단축하고, CPU 및 macOS 환경을 지원하며, 성능 시각화를 포함하여 팀의 실험과 채택을 znacz하게 쉽게 만듭니다.
Infrastructure Perspective
두 연사는 모두 LLM serving이 단순히 프레임워크 선택이 아니라, vastly different environments에서 효율적인 운영을 요구하는 인프라 도전이라고 강조했습니다.
AI Accelerator Integration
Dr. Kim은 vLLM과 AI 액셀러레이터 하드웨어 간의 통합 로드맵을 제시했습니다. Rebellions은 자체 NPU를 vLLM 생태계에 가져오기 위해 vllm‑rbln 플러그인을 개발 중입니다. 핵심 기능인 페이지드 어텐션과 연속 배치는 이미 NPU 환경에서 구현 및 지원되고 있습니다. 더 고급 기능인 speculative decoding, 분산 KV 캐시, prefill/decode disaggregation은 현재 개발 중입니다. Rebel100™과 같은 차세대 NPU는 대규모 추론 클러스터 배치를 가능하게 할 것으로 예상됩니다.
이 접근 방식은 vLLM을 다양한 액셀러레이터를 연결하는 공통 레이어로 삼아 AI 추론 인프라가 재구성되고 있는 보다 넓은 산업 변화를 반영합니다.
vLLM Production Stack: Present and Future
SqueezeBits의 CTO인 Taesoo Kim은 실제 운영 환경에서 현재 제공하는 내용, 그 évolution, 그리고 미래 방향을 다루며 vLLM 생산 스택에 대해 발표했습니다. 중심 주제는 vLLM이 단순히 모델을 serving하는 것을 넘어, 생산 환경이 진정으로 요구하는 운영 기능과 확장성을 steadily 갖추어가고 있다는 것이었습니다.
Track 1: Open Source Focus
Memory and Cache as the Core of LLM Serving Optimization
CXL 3.0 기반 지능형 메모리 반도체를 구축하는 메모리‑중심 컴퓨팅 스타트업 XCENA의 Juho Lee은 vLLM 생산 스택과 KV 캐시 최적화 전략에 대해 논의했습니다. 그는 LLM serving을 클러스터 효율성 문제로 프레임하고, KV 캐시가 어떻게 저장되고 재사용되는지가 동시에 성능과 비용을 결정한다고 주장했습니다.
그의 발표에서는 LMCache를 통한 KV 캐시 티어링 및 라우팅을 소개하여 AI 액셀러레이터 메모리에 대한 의존도를 줄이고, CXL 메모리를 대용량 캐시 확장 계층—메모리 계층의 새로운 층을 형성—으로 탐구했습니다. 이는 LLM 인프라 최적화가 컴퓨팅을 넘어 데이터 이동 및 메모리 아키텍처 자체를 최적화하는 방향으로 이동하고 있음을 시사합니다.
From Open‑Source Model to Production Service
Solar LLM의 개발사인 Upstage의 Inseo Song은 오픈소스 모델을 취득하여 안정적인 프로덕션 서비스로 배포하는 엔지니어링 여정을 공유했습니다. 그는 훈련이 완료된 후에 나타나는 엔지니어링 복잡성을 강조했습니다.
그는 OpenAI‑호환 API, 멀티턴 대화, 추론, 함수 호출, 구조화된 출력과 같은 다양한 요구 사항을 충족하는 Chat Template 설계 과정을 안내하고, 토큰 수준에서 상태를 파싱할 수 있는 구조를 만드는 방법을 설명했습니다. 또한 vLLM 통합 중에 파서와 로짓 프로세서가 어떻게 사용되어 생성 행동을 미세하게 제어하는지 설명했습니다.
핵심 교훈은 “안정적으로 serving하는 것”이 단순히 “좋은 모델을 만드는 것”보다 훨씬 더 복잡한 문제라는 점이었습니다.
Track 2: Business Focus
LLM Operational Strategy in the Enterprise
Samsung Electronics의 Sungsu Kim은 “vLLM으로 민감한 데이터 보호”라는 제목으로 발표했습니다. 그는 엔터프라이즈 배포에서 보안이 단일 가장 중요한 요소라고 주장했습니다.
그는 외부 SaaS 모델을 사용할 수 없는 환경에서 데이터 유출 위험을 제거한 사례를 공유했습니다: 내부 GPU 인프라에 프라이빗 LLM API를 구축하고 모든 요청을 에어갭된 폐쇄 네트워크를 통해 라우팅함으로써 달성했습니다. 해당 시스템은 OpenWebUI, OpenAI‑호환 API, Dify, Claude Code와 같은 인터페이스를 통해 4,000명 이상의 직원을 대상으로 서비스를 제공하고 있습니다. 또한 작업별로 분리된 RAG 기반 에이전트와 접근 제어 구조가 맞춤 개발을 최소화하면서 오픈소스 도구에 의존하여 민감한 데이터를 보호하는 방법을 설명했습니다.
이 세션은 기술 성능만이 방정식의 일부이며, 보안 아키텍처와 운영 설계도 igualmente 중요하다는 명확한 사례를 제시했습니다.
Serving Architecture for the Multimodal Era
NAVER Cloud의 Jaeeun Gil은 HyperCLOVA Omni 모델 serving에 대해 발표했습니다. Omni‑modal 모델—텍스트, 이미지, 오디오를 함께 처리—는 자기회귀 아키텍처와 디퓨전 기반 디코더를 결합하여 구조적으로 이질적이 되고,従来的 접근 방식으로 효율적으로 serving하기 어렵게 만듭니다.
제안된 솔루션은 인코더, LLM, 디코더를 독립적인 단계로 분리하고 각각을 개별적으로 최적화하는 disaggregated serving 아키텍처였습니다. 분석 결과 vision 디코더가 엔드‑투‑엔드 지연의 주요 병목 지점으로 확인되었으며, 전체 지연의 대부분을 차지했습니다. 시퀀스 병렬화와 커널 최적화를 통해 팀은 성능을 3배 이상 향상시켰습니다.
이 발표는 LLM serving이 단일 모델 실행에서 복잡한 다중 컴포넌트 파이프라인 최적화 문제로 진화하고 있음을 보여주었습니다.
Closing Thoughts
모든 세션을 관통하는 일관된 주제는 다음과 같습니다: LLM serving은 특정 모델을 빠르게 실행하는 것이 아니라, 다양한 모델, 이질적인 하드웨어, 복잡한 파이프라인을 규모 있게 효율적으로 운영하는 인프라 문제로 진화했습니다.
기술적 내용 외에도, 미팅은 커뮤니티의 에너지와 깊이를 직접 체험할 수 있는 기회였습니다.
vLLM은 하드웨어 벤더, 클라우드 제공업체, AI 서비스 기업, 최종 사용자 모두가 전략을 구축하고 있는 빠른 변화의 중심에 위치해 있습니다. vLLM을 중심으로 한 기술과 커뮤니티는 계속 확장될 것이며,その中에서 공유되는 실용적이고 현장 중심의 사례 연구는 더욱 풍부해질 것입니다.
Sources
- OriginalvLLM Korea Meetup 2026 Wrap-Up
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch