patchy631/time-to-first-token
A 10-week, 30-minutes-a-day roadmap for LLM inference serving and optimization. vLLM, SGLang, quantization, speculative decoding, benchmarking.
What it solves
이 프로젝트는 엔지니어가 대규모 언어 모델(LLM) 추론에 대한 이론적 지식에서 프로덕션 환경에 적착합한 추론 서비스를 배포하고 최적화하는 단계로 나아가기 위한 구조화된 10주 학습 로드맵을 제공합니다. 파편화된 학습 문제를 해결하기 위해, 계측(instrumented), 부하 테스트(load-tested), 그리고 비용 및 성능 최적화가 완료된 단일하고 성장하는 결과물인 OpenAI-compatible 서비스에 집중합니다.
How it works
로드맵은 사용자를 특정 기술적 마일스톤 시퀀스로 안내하는 50개의 세션(각 30분)으로 구성됩니다:
- Mental Models: roofline model, 연산 강도(arithmetic intensity), 그리고 compute-bound prefill과 memory-bandwidth-bound decode의 차이점을 이해합니다.
- Deployment: vLLM 및 SGLang을 설정하여 모델(예: Llama-3.1-8B)을 서빙하고, PagedAttention 및 RadixAttention과 같은 내부 구조를 탐구합니다.
- Observability: Prometheus 및 Grafana를 사용하여 Time to First Token (TTFT) 및 처리량(throughput)과 같은 지표를 추적하는 측정 스택을 구축합니다.
- Performance Tuning: 양자화(FP8, INT4/AWQ), speculative decoding, 및 KV cache eviction을 구현하고 벤치마킹합니다.
- Infrastructure & Economics: 커스텀 오토스케일링을 포함한 Kubernetes에 배포하고, 단위 경제성(unit economics)을 관리하기 위한 비용 인식 라우터를 구축합니다.
Who it’s for
Python, 커맨드 라인, 그리고 transformer 아키텍처에는 익숙하지만, CUDA, Kubernetes, 또는 전문적인 LLM 서빙 경험이 부족할 수 있는 엔지니어들을 위한 것입니다.
Highlights
- Practical Focus: 모든 세션은 단일 프로덕션급 서빙 스택으로 이어집니다.
- Measurement-First: 최적화를 적용하기 전에 계측 및 부하 테스트(최대 1000+ 동시 요청)를 강조합니다.
- Hardware-Aware: 양자화나 continuous batching과 같은 특정 최적화가 왜 작동하는지 설명하기 위해 roofline model을 가르칩니다.
- Comprehensive Stack: 원시 GPU 렌탈부터 Kubernetes Helm charts 및 비용 라우팅 미들웨어까지 모든 것을 다룹니다.
관련
- 프로젝트
- Dispatch
- Dispatch
- 프로젝트
- 프로젝트