vLLM을 활용한 빠르고 효율적인 LLM 추론 코스 출시
vLLM을 활용한 빠르고 효율적인 LLM 추론 코스 출시
vLLM은 DeepLearning.AI 및 Red Hat과 협력하여 대규모 언어 모델(LLM)의 최적화, 배포 및 벤치마킹의 엔드 투 엔드 라이프사이클을 교육하기 위해 설계된 새로운 실습 코스인 "Fast & Efficient LLM Inference with vLLM"을 출시했습니다. 이 코스는 오픈 소스 LLM을 낮은 지연 시간과 합리적인 비용으로 배포할 때 발생하는 기술적 과제들을 다룹니다.
코스 목표 및 커리큘럼
이 코스는 학습자가 속도-비용-정확도 간의 트레이드오프를 관리할 수 있도록 모델 압축부터 서빙, 최종 벤치마킹에 이르기까지 전문적인 배포 워크플로우를 중심으로 구성되어 있습니다. 추론 및 메모리에 관한 기초 개념으로 시작하여 실무 코드 예제로 넘어갑니다.
기초 개념 및 시각화
커리큘럼은 다음과 같은 LLM 추론의 내부 메커니즘을 설명하기 위해 시각적 학습을 강조합니다:
- Transformer Architecture: 토큰 흐름, 레이어별 계산 분석 및 주요 병목 지점 식별.
- KV Cache: Key-Value (KV) 캐시가 GPU 메모리에 상주하는 방식, 자기회귀(autoregressive) 생성 중의 성장, 그리고 동시 접속 사용자를 처리할 때 발생하는 메모리 압박에 대한 시각화.
- Quantization: 기본 FP16 가중치에서 INT8 또는 INT4로의 전환에 대한 시각적 설명, weight-only 대 weight-and-activation 양자화의 구체적인 이점과 트레이드오프 상세 설명.
- Optimization Techniques: continuous batching, PagedAttention, prefix caching이 효율성을 위해 왜 중요한지에 대한 설명.
실습 학습 모듈
이 코스는 세 가지 주요 단계로 구성되며, 각 단계는 실제 vLLM 서버와 모델을 사용하는 JupyterLab 환경의 실습 랩과 함께 제공됩니다.
모델 압축 (Model Compression)
학습자는 LLM Compressor를 사용하여 전정밀도(full-precision) Qwen 모델을 양자화합니다. 실습은 양자화 전후의 모델 크기를 비교하고 perplexity를 측정하여 정확도에 미치는 영향을 정량화함으로써, GPU 메모리 요구 사항을 줄이는 방법을 보여줍니다.
모델 서빙 (Model Serving)
이 모듈은 vLLM을 사용하여 모델을 배포하고 OpenAI 호환 API를 통해 상호작용하는 방법을 다룹니다. 학습자는 vLLM 메트릭을 모니터링하여 continuous batching이 작동하는 모습을 관찰하고, 동시 요청 중 메모리 사용량 변화를 추적하며, prefix caching이 공유 시스템 프롬프트에 대한 중복 계산을 어떻게 제거하는지 확인합니다.
배포 벤치마킹 (Deployment Benchmarking)
GuideLLM을 사용하여 학습자는 실제 트래픽 패턴을 시뮬레이션하여 부하 상황에서의 처리량(throughput)과 지연 시간(latency)을 측정합니다. 마지막 단계는 lm-eval을 사용하여 모델 품질을 평가함으로써, 배포 결정을 내리기 전에 압축된 모델이 요구되는 정확도 수준을 유지하는지 확인하는 것입니다.
코스 사양
- 제목: Fast & Efficient LLM Inference with vLLM
- 강사: Cedric Clyburn (Red Hat의 Senior Developer Advocate)
- 소요 시간: 약 1.5시간 (9개의 비디오 레슨 및 3개의 실습 코드 랩으로 구성).
- 수준: 중급 (Python 및 기본 LLM 개념에 대한 숙련도 필요).
- 비용: DeepLearning.AI에서 무료로 제공.
"많은 사용자에게 낮은 지연 시간과 합리적인 비용으로 오픈 소스 LLM을 효율적으로 배포하는 것은 도전적인 과제입니다. 이 코스가 그 방법을 보여줄 것입니다." — Andrew Ng