patchy631/time-to-first-token

A 10-week, 30-minutes-a-day roadmap for LLM inference serving and optimization. vLLM, SGLang, quantization, speculative decoding, benchmarking.

它解决了什么问题

该项目提供了一个结构化的、为期 10 周的学习路线图,帮助工程师从对大语言模型(LLM)推理的理论知识,转向部署和优化生产就绪的推理服务。它通过聚焦于单一、不断演进的产物——一个兼容 OpenAI 的服务,并对其进行监控、负载测试以及成本与性能优化,解决了学习碎片化的问题。

工作原理

路线图分为 50 个会话(每个 30 分钟),引导用户按特定顺序完成技术里程碑:

  1. 思维模型:理解 Roofline 模型、算术强度,以及计算受限的预填充(prefill)与内存带宽受限的解码(decode)之间的区别。
  2. 部署:搭建 vLLM 和 SGLang 来提供模型服务(例如 Llama-3.1-8B),并探索其内部实现,如 PagedAttention 和 RadixAttention。
  3. 可观测性:使用 Prometheus 和 Grafana 构建测量栈,跟踪诸如首 token 响应时间(TTFT)和吞吐量等指标。
  4. 性能调优:实现并基准测试量化(FP8、INT4/AWQ)、投机解码和 KV 缓存驱逐。
  5. 基础设施与经济学:在 Kubernetes 上部署并使用自定义自动伸缩,构建成本感知路由器以管理单元经济性。

适用人群

对 Python、命令行和 Transformer 架构熟悉,但可能缺乏 CUDA、Kubernetes 或专业 LLM 服务经验的工程师。

亮点

  • 实用导向:每个会话都直接贡献到单一的生产级服务栈。
  • 测量优先:在进行优化之前,强调仪表化和负载测试(支持 1000+ 并发请求)。
  • 硬件感知:教授 Roofline 模型,解释为何量化或连续批处理等特定优化能够奏效。
  • 完整栈:涵盖从裸 GPU 租用到 Kubernetes Helm Chart 再到成本路由中间件的全部内容。

相关

  • 项目
  • Dispatch
  • Dispatch
  • 项目
  • 项目