WeianMao/triattention

TriAttention — Efficient long reasoning with trigonometric KV cache compression. Enables OpenClaw local deployment on memory-constrained GPUs.

解决的问题

TriAttention 解决了长推理 LLM 中 KV (Key-Value) 缓存的高内存开销和低吞吐量问题。它在不牺牲准确性的情况下,将长推理任务中的 KV 缓存内存占用降低了高达 10.7 倍,并将吞吐量提高了高达 2.5 倍。

工作原理

TriAttention 不采用选择代表性查询来对键进行评分的方法,而是使用三角函数频域压缩。它发现长推理模型中的 pre-RoPE Q/K 向量集中在固定中心周围,并通过三角级数确定距离偏好。通过使用这些中心和范数对键进行评分,它能够在没有现有基于注意力的方法的开销的情况下实现精确的 KV 缓存压缩。

适用对象

适用于处理长上下文 LLM 的开发人员和研究人员,特别是那些部署了 Qwen3 和 DeepSeek-R1 等模型,并需要在从消费级 GPU (如 RTX 4090) 到 NVIDIA DGX 系统和 Apple Silicon Mac 的硬件上减少 VRAM 使用量并提高推理速度的用户。

亮点

  • 显著的效率提升:在 AIME25 基准测试中实现了 10.7 倍的 KV 内存减少和 2.5 倍的吞吐量提升。
  • 广泛的集成:已正式集成到 NVIDIA TensorRT-LLM 中,并支持 vLLM 和 SGLang 后端。
  • 硬件通用性:兼容 Apple Silicon (通过 MLX) 和 AMD GPU (通过社区 ggml 移植版)。
  • 专注于推理:在 AIME24、AIME25 和 MATH-500 等复杂推理数据集上保持完整的注意力准确度。

相关

  • 项目
  • 项目
  • Dispatch
  • 项目
  • 项目