MoonshotAI/FlashKDA

FlashKDA: high-performance Kimi Delta Attention kernels

解決的問題

FlashKDA 提供 Kimi Delta Attention (KDA) 的高效率 CUDA 內核。KDA 是一種線性注意力機制,旨在解決使用此特定注意力變體的模型在速度與記憶體效率方面對高效、硬體加速計算的需求。

工作原理

本專案基於 CUTLASS 庫實作 KDA 內核,專門針對 NVIDIA SM90(H100)及更高架構。它作為 flash-linear-attention (FLA) 庫的後端整合,讓使用者可將標準的 Triton 基礎實作,替換為這些經過優化的 C++ 內核,以獲得更佳效能。

適用對象

專為從事線性注意力模型的 AI 研究人員與工程師設計,也適用於使用 flash-linear-attention 框架,在現代 NVIDIA GPU 上優化模型推論與訓練效能的使用者。

主要亮點

  • 基於 CUTLASS 的高效率內核,專為 SM90+ GPU 設計。
  • 透過自動分發機制,與 flash-linear-attention 庫無縫整合。
  • 支援使用累積序列長度(cu_seqlens)的可變長度批次處理。
  • 支援無狀態與有狀態(初始/最終狀態)的遞迴運算。

相關

  • 專案
  • Dispatch
  • 專案
  • Dispatch
  • 專案