yandex/YaFSDP

YaFSDP: Yet another Fully Sharded Data Parallel

해결하는 문제

YaFSDP는 대규모 언어 모델(LLM)의 사전 학습을 최적화하도록 설계되었으며, 특히 Sharded Data Parallelism에서 발생하는 통신 및 메모리 작업 관련 오버헤드를 타겟으로 합니다. 높은 메모리 압박 하에서 GPU 활용도와 성능을 개선하여 PyTorch의 FSDP(Fully Sharded Data Parallel)보다 빠른 대안을 제공하는 것을 목표로 합니다.

작동 원리

Transformer 기반 신경망 아키텍처에 특화되어 튜닝된 Sharded Data Parallelism 프레임워크를 구현합니다. 통신 및 메모리 작업 오버헤드를 줄임으로써 여러 GPU에 걸친 학습 실행 중 반복 시간을 단축합니다.

대상 사용자

Hugging Face 스택을 사용하여 대규모 GPU 클러스터(64~256개 장치)에서 대규모 Transformer 모델(Llama 2 및 Llama 3 등)을 학습시키는 ML 엔지니어 및 연구자.

주요 특징

  • 성능 향상: 표준 FSDP 대비 LLM 사전 학습 속도 최대 20% 향상.
  • 확장성: 최대 256개의 A100 GPU에서 7B~70B 파라미터 모델을 대상으로 벤치마크 수행.
  • 확장성: 인과적 사전 학습(causal pre-training) 및 지도 미세 조정(SFT) 지원.
  • 통합: 제공되는 예제 및 Docker 이미지를 통해 Hugging Face 생태계와 연동 가능.

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • 프로젝트
  • Dispatch