高速かつ効率的 LLM 推論 with vLLM コース ローンチ
高速かつ効率的 LLM 推論 with vLLM コース ローンチ
vLLMはDeepLearning.AIおよびRed Hatと提携し、エンドツーエンドのライフサイクルにおける最適化、デプロイ、ベンチマークを学ぶ新しいハンズオンコース、「Fast & Efficient LLM 推論 with vLLM」をリリースしました。このコースは、低レイテンシかつ適切なコストでオープンソースLLMをデプロイする技術的課題に対応します。
コースの目的とカリキュラム
このコースは、プロフェッショナルなデプロイメントワークフローを中心に構成されており、モデル圧縮からサービング、最終的なベンチマークへと進むことで、学習者が速度・コスト・精度のトレードオフを管理できるように支援します。推論とメモリに関する基礎概念から始まり、その後実践的なコード例へと移行します。
基礎概念と可視化
このカリキュラムは、LLM推論の内部メカニズムを説明するために視覚的学習を強調しており、以下を含みます:
- Transformer Architecture: トークンフローの分析、層ごとの計算、および主要なボトルネックの特定。
- KV Cache: GPUメモリ内に存在するKey-Value (KV)キャッシュの可視化、自己回帰生成中のその増加、および同時ユーザー処理時の結果としてのメモリ圧力。
- Quantization: デフォルトのFP16重みからINT8またはINT4への移行の視覚的説明、重み専用量子化と重みおよび活性化量子化の具体的な利点とトレードオフの詳細。
- Optimization Techniques: 効率性において継続的バッチング、PagedAttention、プレフィックスキャッシングが重要である理由の説明。
ハンズオン学習モジュール
このコースは、ライブのvLLMサーバーと実際のモデルを使用したJupyterLab環境でのハンズオンラボとペアになった3つの主要なステージで構成されています。
モデル圧縮
学習者はLLM Compressorを使用してフルプレシジョンのQwenモデルを量子化します。このラボでは、量子化前後のモデルサイズを比較し、精度への影響を定量化するためにパープレキシティを測定し、GPUメモリ要件を削減する方法を示します。
モデルサービング
このモジュールでは、vLLMを使用してモデルをデプロイし、OpenAI互換APIを介してやり取りする方法を学びます。学習者はvLLMのメトリクスを監視し、継続的バッチングの動作を観察し、同時リクエスト時のメモリ使用量の変化を追跡し、プレフィックスキャッシングが共有システムプロンプトに対する冗長な計算をどのように排除するかを確認します。
デプロイメントベンチマーク
GuideLLMを使用して、学習者は現実的なトラフィックパターンをシミュレートし、負荷下でのスループットとレイテンシーを測定します。最終ステップでは、lm-evalを使用してモデル品質を評価し、デプロイメントの決定を行う前に圧縮モデルが必要な精度レベルを維持していることを確認します。
コース仕様
- Title: Fast & Efficient LLM 推論 with vLLM
- Instructor: Cedric Clyburn (Red Hatのシニアデベロッパーアドボケート)
- Duration: 約1.5時間、9つのビデオレッスンと3つのハンズオンコードラボで構成。
- Level: 中級(Pythonと基本的なLLM概念に精通していることが必要)。
- Cost: DeepLearning.AIで無料。
"オープンソースLLMを多数のユーザーに対して低レイテンシかつ適切なコストで効率的にデプロイすることは課題です。このコースではその方法を示します。」 — Andrew Ng