SHI-Labs/NATTEN
Fast Multi-dimensional Sparse Attention
What it solves
NATTEN 解决了标准自注意力机制的高计算成本问题,其计算量通常随着 token 的数量呈平方级增长。它提供了一种在注意力机制中引入局部性和稀疏性的方法,使其对于图像 (2D) 和体积数据 (3D) 等多维数据更加高效。
How it works
NATTEN 实现了 Neighborhood Attention (NA),一种滑动窗口自注意力机制。它类似于卷积 (convolutions),允许用户定义 kernel_size、stride 和 dilation 来控制每个维度中的注意力范围。它也支持因果掩码 (causal masking) 以防止 token 参与未来 token 的注意力计算。
为了实现高性能,该项目提供了针对 NVIDIA GPU 优化的 Fused Multi-Headed Attention (FMHA) 和 Fused Neighborhood Attention (FNA) 内核,,对于 Hopper (SM90) 和 Blackwell (SM100, SM103) 架构,提供了原生内核。
Who it’s for
它专为构建用于多维特征图的 Transformer 模型的研究人员和开发者设计,特别是那些从事计算机视觉或 3D 数据处理的工作者。
Highlights
- Multi-dimensional support: 对 2D 和 3D token 布局的原生支持。
- High-performance kernels: 针对从 Maxwell (SM50) 到 Blackwell (SM100/103) 的 的优化融合内核。
- Flexible configuration: 可针对每个维度控制
kernel_size、stride和dilation。 - Causal masking: 为多维稀疏注意力提供切换因果注意力的能力。
相关
- 项目
- 项目
- 项目
- 项目
- 项目