rednote-machine-learning/RedKnot
Efficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention
解決的問題
RedKnot 解決了在長上下文情境下服務大型語言模型(LLMs)所帶來的高計算成本與延遲問題。它特別針對首次詞元時間(TTFT)和算術計算需求進行優化,減少長上下文請求預填充階段的重複工作。
工作原理
RedKnot 是一個基於 SGLang 的模型感知執行框架,透過三種主要機制來優化長上下文服務:
- 頭部分解與聚合: 將注意力頭分類為可重用的局部頭(離線準備)和線上全域/檢索頭。它們的貢獻會在不改變外部介面的情況下合併回模型,支援多種注意力機制,例如 MLA、MHA、GQA 和滑動視窗注意力。
- 稀疏 FFN 與 MoE 執行: 利用詞元層級的重要性來決定哪些行進入前饋網路(FFN),並對混合專家(MoE)模型採用自適應專家 Top-K 選取,減少每個詞元激活的專家數量。
- SegPagedAttention: 此機制按頭和段落組織 KV 頁面與可見性,允許不同類型的頭(全域、局部、檢索)在不需統一快取布局的情況下使用不同的上下文範圍。
適用對象
專為開發者與研究人員設計,適用於高效率 LLM 服務基礎設施的開發,特別是那些在長上下文 RAG(檢索增強生成)場景中部署 DeepSeek-V4-Flash、Mistral、Qwen 和 Llama 3.3 等模型的使用者。
主要特色
- 效能提升: 目標達成熱狀態 TTFT 2–5 倍加速,以及算術計算量 70–90% 的節省。
- 支援 LMM: 建立於 SGLang 之上,支援多種架構,包括 DeepSeek、Mistral、Qwen 和 Llama。
- 硬體相容性: 適用於 NVIDIA H200/B300 GPU,並持續適配 Huawei Ascend NPUs。
- 可重現的基準測試: 提供 DeepSeek-V4-Flash 在不同上下文長度(64K 到 440K)下的封裝重現路徑。
相關
- 專案
- Dispatch
- 專案
- 專案
- 專案