NVIDIA/Megatron-Energon

Megatron's multi-modal data loader

해결하는 문제

Megatron Energon은 대규모 모델을 위한 막대한 양의 다중 모달 학습 데이터를 로드하고 관리하는 문제를 해결합니다. 다양한 데이터셋을 혼합하고, 대규모 클러스터의 노드와 프로세스에 걸쳐 데이터 로드를 분산하는 과정을 단순화하면서도 재현성과 재시작 가능성을 유지합니다.

작동 방식

Energon은 Megatron-LM 프레임워크의 일부로 사용하거나, 독립적인 Python 패키지로 사용할 수 있는 다중 모달 데이터 로더입니다. WebDataset과 JSONL 형식을 지원합니다. 사용자는 명령줄 도구 (energon)를 사용하여 데이터셋을 준비하고 유효성 검사를 수행하여 시스템과의 호환성을 보장할 수 있습니다. 준비가 완료되면 get_train_datasetget_loader와 같은 함수를 통해 트레이닝 루프에 데이터를 공급할 수 있습니다.

대상 사용자

다양한 유형의 데이터 샘플과 처리를 처리할 수 있는 확장 가능하고 분산형 데이터 파이프라인을 필요로 하는 대규모 다중 모달 모델을 훈련하는 연구자 및 엔지니어를 위한 것입니다.

주요 특징

  • 클러스터 규모의 분산: 여러 노드와 프로세스에 걸쳐 데이터 로드 작업을 효율적으로 분산합니다.
  • 다중 모달 지원: 다양한 유형의 데이터 샘플을 처리하도록 특별히 설계되었습니다.
  • 데이터셋 블렌딩: 여러 다른 데이터셋을 혼합하고 결합할 수 있는 기능이 있습니다.
  • 신뢰성: 트레이닝 실행이 재현 가능하며, 중단된 지점에서 다시 시작할 수 있도록 보장합니다.

관련

  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트