WeianMao/triattention
TriAttention — Efficient long reasoning with trigonometric KV cache compression. Enables OpenClaw local deployment on memory-constrained GPUs.
解決的問題
TriAttention 解決了長推理 LLM 中 KV (Key-Value) 快取的高記憶體開銷與低吞吐量問題。它在不犧牲準確性的情況下,將長推理任務中的 KV 快取記憶體佔用降低了高達 10.7 倍,並將吞吐量提高了高達 2.5 倍。
工作原理
TriAttention 不採用選擇代表性查詢來對鍵進行評分的方法,而是使用三角函數頻域壓縮。它發現長推理模型中的 pre-RoPE Q/K 向量集中在固定中心周圍,並透過三角級數確定距離偏好。透過使用這些中心與範數對鍵進行評分,它能夠在沒有現有基於注意力方法之開銷的情況下,實現精確的 KV 快取壓縮。
適用對象
適用於處理長上下文 LLM 的開發人員與研究人員,特別是那些部署了 Qwen3 與 DeepSeek-R1 等模型,並需要在從消費級 GPU (如 RTX 4090) 到 NVIDIA DGX 系統與 Apple Silicon Mac 的硬體上減少 VRAM 使用量並提高推理速度的使用者。
亮點
- 顯著的效率提升:在 AIME25 基準測試中實現了 10.7 倍的 KV 記憶體減少與 2.5 倍的吞吐量提升。
- 廣泛的整合:已正式整合至 NVIDIA TensorRT-LLM 中,並支援 vLLM 與 SGLang 後端。
- 硬體通用性:相容於 Apple Silicon (透過 MLX) 與 AMD GPU (透過社群 ggml 移植版)。
- 專注於推理:在 AIME24、AIME25 與 MATH-500 等複雜推理數據集上保持完整的注意力準確度。
相關
- 專案
- 專案
- Dispatch
- 專案
- 專案