rednote-machine-learning/RedKnot
Efficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention
何を解決するか
RedKnotは、長いコンテキストにおける大規模言語モデル(LLM)のサービングに伴う高い計算コストとレイテンシに対処します。具体的には、Time to First Token (TTFT) と算術計算の要件をターゲットとし、長いコンテキストのリクエストのプリフィル(prefill)フェーズにおける冗長な作業を削減します。
仕組み
RedKnotは、SGLang上に構築されたモデル認識型の実行フレームワークであり、長いコンテキストのサービングを最適化するために主に3つのメカニズムを採用しています:
- Head Decomposition and Aggregation (ヘッドの分解と集約): アテンション・ヘッドを、再利用可能なローカル・ヘッド(オフラインで準備)と、オンラインのグローバル/リトリーバル・ヘッドに分類します。それらの寄与は、外部インターフェースを変更することなくモデルに統合され、MLA、MHA、GQA、およびsliding-window attentionのような様々なアテンション・メカニズムをサポートします。
- Sparse FFN and MoE Execution (スパースFFNおよびMoEの実行): トークンレベルの重要度を使用して、どの行がFeed-Forward Network (FFN) に入るかを決定し、Mixture-of-Experts (MoE) モデルに対しては適応的なエキスパートTop-K選択を採用することで、トークンあたりのアクティブなエキスパートの数を削減します。
- SegPagedAttention: これは、ヘッドとセグメントごとにKVページと可視性を整理し、異なるタイプのヘッド(グローバル、ローカル、リトリーバル)が、統一されたキャッシュレイアウトを必要とせずに異なるコンテキスト・スコープを消費できるようにします。
対象ユーザー
高パフォーマンスなLLMサービング・インフラストラクチャに取り組む開発者や研究者、特にDeepSeek-V4-Flash、Mistral、Qwen、Llama 3.3などのモデルを長いコンテキストのRAG (Retrieval-Augmented Generation) シナリオで展開している人々を対象としています。
ハイライト
- パフォーマンスの向上: ホットステートのTTFTで2〜5倍の高速化、および算術計算で70〜90%の削減をターゲットとしています。
- LMM Support: SGLang上に構築されており、DeepSeek、Mistral、Qwen、Llamaを含む幅広いアーキテクチャをサポートしています。
- Hardware Compatibility: NVIDIA H200/B300 GPU向けに最適化されており、Huawei Ascend NPUへの継続的な適応も含まれています。
- Reproducible Benchmarks: さまざまなコンテキスト長(64Kから440K)にわたるDeepSeek-V4-Flashのパッケージ化された再現パスを提供します。
関連
- プロジェクト
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト