feifeibear/long-context-attention

USP: Unified (a.k.a. Hybrid, 2D) Sequence Parallel Attention for Long Context Transformers Model Training and Inference

해결하는 문제

YunChang은 장문 컨텍스트 LLM 학습 및 추론에 널리 사용되는 두 가지 분산 어텐션 방법인 DeepSpeed-Ulysses와 Ring-Attention의 한계를 해결하는 Unified Sequence Parallelism (USP)을 구현합니다. Ulysses는 어텐션 헤드 수에 제한이 있어 GQA나 MQA에 적합하지 않으며, Ring-Attention은 일반적으로 계산 및 통신 효율이 낮고 대규모 배포 시 데드락 위험이 있습니다.

작동 방식

USP는 DeepSpeed-Ulysses와 Ring-Attention의 장점을 결합한 하이브리드 시퀀스 병렬 접근 방식입니다. 사용자는 Ulysses의 정도와 Ring의 정도를 설정하여 시퀀스를 GPU 간에 분할할 수 있습니다. 이 프로젝트는 FlashAttention (v2 및 v3), Torch Efficient 및 SageAttention, FlashInfer와 같은 다양한 어텐션 백엔드와 통합되며, 인과 마스크에 대한 로드 밸런싱 전략(예: "zigzag", "stripe")을 제공하여 성능을 최적화합니다.

대상 사용자

복수의 GPU에 걸쳐 시퀀스 길이를 확장해야 하는 장문 컨텍스트 생성형 AI 모델을 학습하거나 배포하는 연구자 및 엔지니어를 대상으로 하며, 특히 GQA/MQA 아키텍처나 이질적인 네트워크 하드웨어를 사용하는 경우에 적합합니다.

주요 특징

  • 하이브리드 접근 방식: Ulysses와 Ring 어텐션을 융합하여 헤드 수 제한과 통신 비효율성을 극복합니다.
  • 광범위한 하드웨어 지원: NVIDIA GPU(H100, A100 등) 및 NPU와 호환됩니다.
  • 유연한 백엔드 지원: FlashAttention v2/v3, SageAttention, FlashInfer를 지원합니다.
  • 통합성: 이미 NVIDIA의 TransformerEngine에 적용되었으며, Megatron-LM 프레임워크와 호환됩니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트