patchy631/time-to-first-token
A 10-week, 30-minutes-a-day roadmap for LLM inference serving and optimization. vLLM, SGLang, quantization, speculative decoding, benchmarking.
它解決了什麼問題
本專案提供一個結構化的 10 週學習路線圖,讓工程師能夠從大型語言模型(LLM)推理的理論知識,進階到部署與優化可投入生產的推理服務。它透過聚焦於單一、持續成長的產物——一個兼容 OpenAI 的服務,並已完成儀表化、負載測試與成本與效能的最佳化,解決了學習資源碎片化的問題。
它如何運作
此路線圖分為 50 個環節(每環節 30 分鐘),引導使用者依序完成特定的技術里程碑:
- 心智模型:了解 roofline 模型、算術密集度,以及 compute‑bound prefill 與 memory‑bandwidth‑bound decode 之間的差異。
- 部署:設定 vLLM 與 SGLang 以提供模型服務(例如 Llama-3.1-8B),並探索其內部機制,如 PagedAttention 與 RadixAttention。
- 可觀測性:使用 Prometheus 與 Grafana 建置測量堆疊,追蹤 Time to First Token(TTFT)與吞吐量等指標。
- 效能調校:實作與基準測試量化(FP8、INT4/AWQ)、投機解碼與 KV 快取驅逐。
- 基礎設施與經濟學:在 Kubernetes 上部署,搭配自訂自動擴縮,並構建成本感知的路由器以管理單位經濟性。
目標對象
對 Python、命令列與 transformer 架構熟悉,但可能缺乏 CUDA、Kubernetes 或專業 LLM 服務經驗的工程師。
重點特色
- 實務導向:每個環節皆匯入同一套可投入生產的服務堆疊。
- 測量優先:在套用最佳化之前,強調儀表化與負載測試(支援 1000+ 並發請求)。
- 硬體感知:教導 roofline 模型,說明為何量化或持續批次等特定最佳化能發揮效用。
- 完整堆疊:涵蓋從 GPU 租用、Kubernetes Helm chart 到成本路由中介層的全部內容。
相關
- 專案
- Dispatch
- Dispatch
- 專案
- 專案