facebookresearch/fairseq2

FAIR Sequence Modeling Toolkit 2

What it solves

fairseq2는 연구자들이 콘텐츠 생성 작업을 위한 맞춤형 모델을 학습할 수 있도록 설계된 시퀀스 모델링 툴킷입니다. 기존 fairseq를 깔끔하고 모듈화된 API와 확장 가능한 아키텍처로 대체하여, 연구자들이 단일 거대 프레임워크에 의존하지 않고 자체 프로젝트 코드베이스를 독립적으로 유지 관리할 수 있게 합니다.

How it works

torch.compile 및 PyTorch FSDP 등 최신 PyTorch 도구를 활용해 고성능 학습 및 추론을 제공합니다. 툴킷에는 C++로 작성된 스트리밍 기반 데이터 파이프라인 API가 포함되어 있어 높은 처리량을 제공하며, 특히 음성 및 비디오 디코딩을 지원합니다. 또한 결정론적 구성을 위한 구조화된 API와 모델, 데이터셋, 토크나이저에 대한 버전 관리된 접근을 가능하게 하는 프로그래밍 가능한 자산 카드도 제공합니다.

Who it’s for

시퀀스 모델링 및 콘텐츠 생성에 종사하는 AI 연구자와 개발자를 위한 것이며, 특히 멀티 GPU 및 멀티 노드 환경에서 70B+ 파라미터 모델을 확장해야 하는 경우에 적합합니다.

Highlights

  • Scalable Training: DDP, FSDP, 텐서 병렬을 활용한 멀티 GPU·멀티 노드 학습을 지원하여 매우 큰 모델도 학습 가능.
  • Extensible Architecture: setuptools 확장 메커니즘을 사용해 새로운 모델, 옵티마이저, 트레이너를 등록할 수 있어 라이브러리를 포크할 필요가 없습니다.
  • litre-Integrated Inference: vLLM을 네이티브로 지원하고, 내장된 샘플링 및 빔 서치 생성기를 제공합니다.
  • Specialized Recipes: 인스트럭션 파인튜닝 및 프리퍼런스 최적화를 위한 공식 레시피를 제공합니다.
  • High-Throughput Data: 음성 및 비디오 데이터를 효율적으로 처리하는 C++ 기반 스트리밍 데이터 파이프라인을 갖추고 있습니다.