patchy631/time-to-first-token
A 10-week, 30-minutes-a-day roadmap for LLM inference serving and optimization. vLLM, SGLang, quantization, speculative decoding, benchmarking.
它解决了什么问题
该项目提供了一个结构化的、为期 10 周的学习路线图,帮助工程师从对大语言模型(LLM)推理的理论知识,转向部署和优化生产就绪的推理服务。它通过聚焦于单一、不断演进的产物——一个兼容 OpenAI 的服务,并对其进行监控、负载测试以及成本与性能优化,解决了学习碎片化的问题。
工作原理
路线图分为 50 个会话(每个 30 分钟),引导用户按特定顺序完成技术里程碑:
- 思维模型:理解 Roofline 模型、算术强度,以及计算受限的预填充(prefill)与内存带宽受限的解码(decode)之间的区别。
- 部署:搭建 vLLM 和 SGLang 来提供模型服务(例如 Llama-3.1-8B),并探索其内部实现,如 PagedAttention 和 RadixAttention。
- 可观测性:使用 Prometheus 和 Grafana 构建测量栈,跟踪诸如首 token 响应时间(TTFT)和吞吐量等指标。
- 性能调优:实现并基准测试量化(FP8、INT4/AWQ)、投机解码和 KV 缓存驱逐。
- 基础设施与经济学:在 Kubernetes 上部署并使用自定义自动伸缩,构建成本感知路由器以管理单元经济性。
适用人群
对 Python、命令行和 Transformer 架构熟悉,但可能缺乏 CUDA、Kubernetes 或专业 LLM 服务经验的工程师。
亮点
- 实用导向:每个会话都直接贡献到单一的生产级服务栈。
- 测量优先:在进行优化之前,强调仪表化和负载测试(支持 1000+ 并发请求)。
- 硬件感知:教授 Roofline 模型,解释为何量化或连续批处理等特定优化能够奏效。
- 完整栈:涵盖从裸 GPU 租用到 Kubernetes Helm Chart 再到成本路由中间件的全部内容。
相关
- 项目
- Dispatch
- Dispatch
- 项目
- 项目