WeianMao/triattention

TriAttention — Efficient long reasoning with trigonometric KV cache compression. Enables OpenClaw local deployment on memory-constrained GPUs.

解決する課題

TriAttentionは、長文推論LLMにおけるKV (Key-Value) キャッシュの高メモリオーバーヘッドとスループットの低さを解決します。精度を損なうことなく、長文推論タスクにおいてKVキャッシュのメモリ使用量を最大10.7倍削減し、スループットを最大2.5倍向上させます。

仕組み

TriAttentionは、代表的なクエリを選択してキーをスコアリングする代わりに、三角関数周波数領域圧縮を使用します。長文推論モデルにおけるRoPE適用前のQ/Kベクトルが、三角級数を通じて距離の好みを決定する固定の中心付近に集中していることを特定しました。これらの中心点とノルムを使用してキーをスコアリングすることで、既存のアテンションベースの手法のようなオーバーヘッドなしに、正確なKVキャッシュ圧縮を可能にします。

対象者

長文コンテキストLLMを扱う開発者や研究者、特にQwen3やDeepSeek-R1などのモデルをデプロイし、コンシューマー向けGPU (RTX 4090など) からNVIDIA DGXシステム、Apple Silicon Macに至るハードウェアでVRAM使用量の削減と推論速度の向上を必要としている方に適しています。

ハイライト

  • 大幅な効率向上: AIME25ベンチマークにおいて、KVメモリの10.7倍削減と2.5倍のスループット向上を達成。
  • 幅広い統合: NVIDIA TensorRT-LLMに公式に統合されており、vLLMおよびSGLangバックエンドをサポート。
  • ハードウェアの汎用性: Apple Silicon (MLX経由) および AMD GPU (コミュニティのggmlポート経由) と互換性あり。
  • 推論特化型: AIME24、AIME25、MATH-500などの複雑な推論データセットにおいて、完全なアテンション精度を維持。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト