patchy631/time-to-first-token

A 10-week, 30-minutes-a-day roadmap for LLM inference serving and optimization. vLLM, SGLang, quantization, speculative decoding, benchmarking.

What it solves

このプロジェクトは、エンジニアが大規模言語モデル(LLM)の推論に関する理論的な知識から、本番環境向けの推論サービスのデプロイと最適化へと移行するための、構造化された10週間の学習ロードマップを提供します。断片的な学習という問題を、単一の成長し続けるアーティファクト、つまり、計測、負荷テスト、およびコストとパフォーマンスのために最適化されたOpenAI互換サービスに焦点を当てることで解決します。

How it works

このロードマップは50のセッション(各30分)で構成されており、特定の技術的なマイルストーンのシーケンスに従ってユーザーを導きます:

  1. Mental Models: roofline model、算術強度(arithmetic intensity)、および、compute-boundなprefillとmemory-bandwidth-boundなdecodeの違いを理解すること。
  2. Deployment: vLLMやSGLangを使用してモデル(例:Llama-3.1-8B)をサーブし、PagedAttentionやRadixAttentionのような内部構造を探索すること。
  3. Observability: PrometheusとGrafanaを使用して、Time to First Token (TTFT) やスループットなどのメトリクスを追跡するための計測スタックを構築すること。
  4. Performance Tuning: 量子化(FP8、INT4/AWQ)、投機的デコーディング(speculative decoding)、およびKV cache evictionを実装し、ベンチマークを取ること。
  5. Infrastructure & Economics: カスタムのオートスケーリングを備えたKubernetesへのデプロイ、およびユニットエコノミクスを管理するためのコストを意識したルーターの構築。

Who it’s for

Python、コマンドライン、およびtransformerアーキテクチャに精通しているが、CUDA、Kubernetes、またはプロフェッショナルなLLMサービングの経験が不足している可能性があるエンジニア。

Highlights

  • Practical Focus: すべてのセッションは、単一の本番グレードのサービングスタックへとつながります。
  • Measurement-First: 最適化を適用する前に、計測と負荷テスト(最大1000以上の同時リクエスト)を重視します。
  • Hardware-Aware: 量子化やcontinuous batchingのような特定の最適化がなぜ機能するのかを説明するために、roofline modelを教えます。
  • Comprehensive Stack: 生のGPUレンタルから、Kubernetes Helm charts、およびコストルーティング・ミドルウェアまで、すべてを網羅しています。

関連

  • プロジェクト
  • Dispatch
  • Dispatch
  • プロジェクト
  • プロジェクト