MoonshotAI/FlashKDA

FlashKDA: high-performance Kimi Delta Attention kernels

何を解決するか

FlashKDA は、Kimi Delta Attention (KDA) のための高性能 CUDA カーネルを提供します。これは線形アテンション機構であり、この特定のアテンション変種を使用するモデルの速度とメモリ効率を向上させるために、効率的でハードウェア加速された計算の必要性に対応しています。

動作方法

このプロジェクトは、CUTLASS ライブラリに基づいた KDA カーネルを実装しており、特に NVIDIA SM90 (H100) 以降のアーキテクチャを対象としています。flash-linear-attention (FLA) ライブラリのバックエンドとして統合され、ユーザーが標準の Triton ベース実装の代わりに、より高いパフォーマンスを発揮する最適化された C++ カーネルを使用できるようにします。

対象ユーザー

線形アテンションモデルを扱っている AI 研究者やエンジニア、および flash-linear-attention フレームワークを利用して、最新の NVIDIA GPU 上でモデルの推論およびトレーニングパフォーマンスを最適化したい方々を対象としています。

特徴

  • SM90+ GPU 向けに CUTLASS に基づいた高性能カーネル。
  • flash-linear-attention ライブラリとの自動ディスパッチによるシームレスな統合。
  • 累積シーケンス長 (cu_seqlens) を使用した可変長バッチ処理のサポート。
  • 状態なしおよび状態あり(初期/最終状態)の再帰的計算の両方をサポート。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • Dispatch
  • プロジェクト