vLLM 快速且高效的 LLM 推理课程上线

vLLM 快速且高效的 LLM 推理课程上线

vLLM 已与 DeepLearning.AI 和 Red Hat 合作推出了一门全新的实战课程——“Fast & Efficient LLM Inference with vLLM”,旨在教授优化、部署和基准测试大语言模型 (LLM) 的端到端生命周期。该课程解决了以低延迟和合理成本部署开源 LLM 的技术挑战。

课程目标与课程设置

本课程围绕专业的部署工作流构建,从模型压缩到模型服务,最后到基准测试,帮助学习者管理速度、成本与准确性之间的权衡。课程从推理和内存的基础概念开始,随后过渡到实际的代码示例。

基础概念与可视化

课程强调通过可视化学习来解释 LLM 推理的内部机制,包括:

  • Transformer Architecture:分析 token 流、逐层计算,并识别主要的瓶颈。
  • KV Cache:可视化 Key-Value (KV) cache 如何驻留在 GPU 内存中,其在自回归生成过程中的增长情况,以及在处理并发用户时产生的内存压力。
  • Quantization:通过可视化解释从默认 FP16 权重向 INT8 或 INT4 的转换,详细说明仅权重 (weight-only) 与权重及激活 (weight-and-activation) 量化各自的具体优势和权衡。
  • Optimization Techniques:解释为什么 continuous batching、PagedAttention 和 prefix caching 对效率至关重要。

实战学习模块

课程包含三个主要阶段,每个阶段都配有一个在 JupyterLab 环境下的实战实验,使用实时的 vLLM 服务器和真实模型。

Model Compression

学习者将使用 LLM Compressor 对全精度 Qwen 模型进行量化。实验重点在于比较量化前后模型的大小,并测量困惑度 (perplexity) 以量化对准确性的影响,从而演示如何降低 GPU 内存需求。

Model Serving

该模块涵盖使用 vLLM 部署模型并通过 OpenAI 兼容的 API 与其交互。学习者将监控 vLLM 指标以观察 continuous batching 的实际运行情况,跟踪并发请求期间内存利用率的变化,并了解 prefix caching 如何消除共享系统提示词的冗余计算。

Deployment Benchmarking

使用 GuideLLM,学习者可以模拟真实的流量模式,以测量负载下的吞吐量和延迟。最后一步是使用 lm-eval 评估模型质量,确保压缩后的模型在做出部署决策前保持所需的准确度水平。

课程规格

  • Title: Fast & Efficient LLM Inference with vLLM
  • Instructor: Cedric Clyburn (Red Hat 高级开发者倡导者)
  • Duration: 约 1.5 小时,包含 9 个视频课程和 3 个实战代码实验。
  • Level: 中级(需要熟悉 Python 和基础 LLM 概念)。
  • Cost: 在 DeepLearning.AI 上免费。

“高效地为大量用户部署具有低延迟和合理成本的开源 LLM 是具有挑战性的。本课程将教你如何实现。” —— Andrew Ng

Sources