Fast & Efficient LLM Inference with vLLM 課程發布

Fast & Efficient LLM Inference with vLLM 課程發布

vLLM 與 DeepLearning.AI 和 Red Hat 合作,推出了一個新的實作課程,「Fast & Efficient LLM Inference with vLLM」,旨在教授優化、部署和基準測試大型語言模型(LLM)的端到端生命週期。該課程解決了以低延遲和合理成本部署開源 LLM 的技術挑戰。

課程目標與課程大綱

課程圍繞專業部署工作流程結構,從模型壓縮到服務以及最終基準測試,幫助學習者管理速度-成本-準確度的權衡。它從關於推理和記憶的基礎概念開始,然後過渡到實際程式碼範例。

基礎概念與視覺化

課程強調視覺學習,以解釋 LLM 推理的內部機制,包括:

  • Transformer Architecture: token 流動的分析、逐層計算以及主要瓶頸的識別。
  • KV Cache: 顯示 Key-Value (KV) cache 如何位於 GPU 記憶體中、在自回歸生成過程中的增長,以及處理並發用戶時產生的記憶體壓力。
  • Quantization: 從預設 FP16 權重過渡到 INT8 或 INT4 的視覺說明,詳細說明僅權重量化與權重和激活量化的具體優勢與權衡。
  • Optimization Techniques: 解釋為何連續批次處理、PagedAttention 和前置緩存對效率至關重要。

實作學習模組

課程包含三個主要階段,每個階段都配有在 JupyterLab 環境中使用即時 vLLM 伺服器和實際模型的實作實驗。

模型壓縮

學習者使用 LLM Compressor 對完整精度的 Qwen 模型進行量化。該實驗專注於比較量化前後的模型大小,並測量困惑度(perplexity)以量化對準確度的影響,展示如何降低 GPU 記憶體需求。

模型服務

此模組涵蓋使用 vLLM 部署模型,並透過 OpenAI 相容 API 與其互動。學習者監控 vLLM 指標以觀察連續批次處理的實際運作,追蹤並發請求期間的記憶體利用率變化,並看到前置緩存如何消除共享系統提示詞的重複計算。

部署基準測試

使用 GuideLLM,學習者模擬真實流量模式以在負載下測量吞吐量和延遲。最終步驟涉及使用 lm-eval 評估模型品質,以確保壓縮模型在做出部署決策前保持所需的準確度水準。

課程規格

  • Title: Fast & Efficient LLM Inference with vLLM
  • Instructor: Cedric Clyburn (Red Hat 高級開發倡導者)
  • Duration: 約 1.5 小時,包含 9 節視頻課程和 3 個動手實作程式碼實驗。
  • Level: 中級(需要熟悉 Python 和基本 LLM 概念)。
  • Cost: 在 DeepLearning.AI 上免費。

"以低延遲和合理成本高效部署開源 LLM 對許多用戶來說具有挑戰性。此課程將示範如何做到这一点。" — Andrew Ng

Sources