WeianMao/triattention
TriAttention — Efficient long reasoning with trigonometric KV cache compression. Enables OpenClaw local deployment on memory-constrained GPUs.
解决的问题
TriAttention 解决了长推理 LLM 中 KV (Key-Value) 缓存的高内存开销和低吞吐量问题。它在不牺牲准确性的情况下,将长推理任务中的 KV 缓存内存占用降低了高达 10.7 倍,并将吞吐量提高了高达 2.5 倍。
工作原理
TriAttention 不采用选择代表性查询来对键进行评分的方法,而是使用三角函数频域压缩。它发现长推理模型中的 pre-RoPE Q/K 向量集中在固定中心周围,并通过三角级数确定距离偏好。通过使用这些中心和范数对键进行评分,它能够在没有现有基于注意力的方法的开销的情况下实现精确的 KV 缓存压缩。
适用对象
适用于处理长上下文 LLM 的开发人员和研究人员,特别是那些部署了 Qwen3 和 DeepSeek-R1 等模型,并需要在从消费级 GPU (如 RTX 4090) 到 NVIDIA DGX 系统和 Apple Silicon Mac 的硬件上减少 VRAM 使用量并提高推理速度的用户。
亮点
- 显著的效率提升:在 AIME25 基准测试中实现了 10.7 倍的 KV 内存减少和 2.5 倍的吞吐量提升。
- 广泛的集成:已正式集成到 NVIDIA TensorRT-LLM 中,并支持 vLLM 和 SGLang 后端。
- 硬件通用性:兼容 Apple Silicon (通过 MLX) 和 AMD GPU (通过社区 ggml 移植版)。
- 专注于推理:在 AIME24、AIME25 和 MATH-500 等复杂推理数据集上保持完整的注意力准确度。
相关
- 项目
- 项目
- Dispatch
- 项目
- 项目