patchy631/time-to-first-token

A 10-week, 30-minutes-a-day roadmap for LLM inference serving and optimization. vLLM, SGLang, quantization, speculative decoding, benchmarking.

它解決了什麼問題

本專案提供一個結構化的 10 週學習路線圖,讓工程師能夠從大型語言模型(LLM)推理的理論知識,進階到部署與優化可投入生產的推理服務。它透過聚焦於單一、持續成長的產物——一個兼容 OpenAI 的服務,並已完成儀表化、負載測試與成本與效能的最佳化,解決了學習資源碎片化的問題。

它如何運作

此路線圖分為 50 個環節(每環節 30 分鐘),引導使用者依序完成特定的技術里程碑:

  1. 心智模型:了解 roofline 模型、算術密集度,以及 compute‑bound prefill 與 memory‑bandwidth‑bound decode 之間的差異。
  2. 部署:設定 vLLM 與 SGLang 以提供模型服務(例如 Llama-3.1-8B),並探索其內部機制,如 PagedAttention 與 RadixAttention。
  3. 可觀測性:使用 Prometheus 與 Grafana 建置測量堆疊,追蹤 Time to First Token(TTFT)與吞吐量等指標。
  4. 效能調校:實作與基準測試量化(FP8、INT4/AWQ)、投機解碼與 KV 快取驅逐。
  5. 基礎設施與經濟學:在 Kubernetes 上部署,搭配自訂自動擴縮,並構建成本感知的路由器以管理單位經濟性。

目標對象

對 Python、命令列與 transformer 架構熟悉,但可能缺乏 CUDA、Kubernetes 或專業 LLM 服務經驗的工程師。

重點特色

  • 實務導向:每個環節皆匯入同一套可投入生產的服務堆疊。
  • 測量優先:在套用最佳化之前,強調儀表化與負載測試(支援 1000+ 並發請求)。
  • 硬體感知:教導 roofline 模型,說明為何量化或持續批次等特定最佳化能發揮效用。
  • 完整堆疊:涵蓋從 GPU 租用、Kubernetes Helm chart 到成本路由中介層的全部內容。

相關

  • 專案
  • Dispatch
  • Dispatch
  • 專案
  • 專案