rednote-machine-learning/RedKnot

Efficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention

它解决了什么问题

RedKnot 解决了在长上下文场景下服务大型语言模型(LLMs)所面临的高计算成本和延迟问题。它特别针对首次标记时间(TTFT)和算术计算需求,减少了长上下文请求预填充阶段的重复工作。

它如何工作

RedKnot 是一个基于 SGLang 的模型感知执行框架,通过三种主要机制优化长上下文服务:

  • 头部分解与聚合: 它将注意力头部分类为可重用的局部头部(离线准备)和在线全局/检索头部。它们的贡献在不改变外部接口的情况下合并回模型,支持多种注意力机制,如 MLA、MHA、GQA 和滑动窗口注意力。
  • 稀疏 FFN 与 MoE 执行: 它使用标记级别的重要性来确定哪些行进入前馈网络(FFN),并为混合专家(MoE)模型采用自适应专家 Top-K 选择,减少每个标记激活的专家数量。
  • SegPagedAttention: 它按头部和段组织 KV 页及其可见性,允许不同类型的头部(全局、局部、检索)在不需统一缓存布局的情况下消费不同的上下文范围。

适用于谁

它专为从事高性能 LLM 服务基础设施开发的开发者和研究人员设计,尤其适用于在长上下文 RAG(检索增强生成)场景中部署 DeepSeek-V4-Flash、Mistral、Qwen 和 Llama 3.3 等模型的用户。

主要亮点

  • 性能提升: 目标实现热态 TTFT 2–5 倍加速,算术计算节省 70–90%。
  • 支持 LMM: 基于 SGLang 构建,支持多种架构,包括 DeepSeek、Mistral、Qwen 和 Llama。
  • 硬件兼容性: 针对 NVIDIA H200/B300 GPU 优化,并持续适配华为 Ascend NPUs。
  • 可复现的基准测试: 提供 DeepSeek-V4-Flash 在不同上下文长度(64K 到 440K)下的打包复现路径。

相关

  • 项目
  • Dispatch
  • 项目
  • 项目
  • 项目