feifeibear/long-context-attention
USP: Unified (a.k.a. Hybrid, 2D) Sequence Parallel Attention for Long Context Transformers Model Training and Inference
解决的问题
YunChang 实现了统一序列并行(USP),解决了两种常用于长上下文 LLM 训练和推理的分布式注意力方法——DeepSpeed-Ulysses 和 Ring-Attention 的局限性。Ulysses 受限于注意力头数量(不适用于 GQA 或 MQA),而 Ring-Attention 在计算和通信上通常效率较低,并且在大规模部署中可能引发死锁。
工作原理
USP 作为一种混合序列并行方法,结合了 DeepSpeed-Ulysses 和 Ring-Attention 的优势。用户可以设置 Ulysses 度和 Ring 度,将序列跨 GPU 分区。该项目与多种注意力后端集成,包括 FlashAttention(v2 和 v3)、Torch Efficient,以及其他如 SageAttention 和 FlashInfer。它还提供了负载均衡策略(如 "zigzag" 和 "stripe")用于因果掩码,以优化性能。
适用人群
专为需要在多个 GPU 上扩展序列长度的研究人员和工程师设计,尤其适用于使用 GQA/MQA 架构或异构网络硬件的长上下文生成式 AI 模型训练或部署场景。
亮点
- 混合方法:融合 Ulysses 和 Ring 注意力,克服头数限制和通信低效问题。
- 广泛硬件支持:兼容 NVIDIA GPU(H100、A100 等)和 NPU。
- 灵活后端:支持 FlashAttention v2/v3、SageAttention 和 FlashInfer。
- 集成性:已应用于 NVIDIA 的 TransformerEngine,并与 Megatron-LM 框架兼容。
相关
- 项目
- 项目
- 项目
- 项目