fla-org/flash-linear-attention

🚀 Efficient implementations for emerging model architectures

解决的问题

Flash Linear Attention (fla) 提供了旨在替代或增强标准 Transformer 注意力的现代序列模型的硬件高效实现。它通过提供线性注意力、状态空间模型(SSMs)和混合架构的优化内核,解决了传统 softmax 注意力的计算瓶颈,从而在各种硬件平台上实现更高效的训练和推理。

如何工作

该项目提供了一组可集成到 LLM 架构中的「token mixing」层和融合模块。它实现了多种亚二次内核,如 Mamba、RetNet、RWKV 和 Gated Linear Attention (GLA),这些内核与平台无关,并已在 NVIDIA、AMD 和 Intel 硬件上验证通过。这些实现设计为可直接用于训练,通常还包含融合层(例如融合线性和交叉熵层),以减少训练期间的内存使用。

适用人群

正在开发或部署超越标准 Transformer 的序列模型的 AI 研究人员和机器学习工程师,特别是那些专注于线性注意力、SSMs 或混合 LLM 架构的人。

主要亮点

  • 广泛模型支持:实现了大量前沿的线性注意力和 SSM 模型,包括 Mamba2/3、RWKV6/7、RetNet 和 GLA。
  • 硬件无关:已在 NVIDIA、AMD 和 Intel 硬件上验证通过的实现。
  • 训练优化:包含融合模块并支持上下文并行训练,可在序列维度上实现高效的分布式训练。
  • 与 Transformers 兼容:提供与 Hugging Face Transformers 库兼容的模型实现。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目