colinlikescode/NanoGPT-Speedrun-Winner
Record breaking score (as of the first commit date)
해결하는 문제
이 프로젝트는 단일 8xH100 GPU 노드에서 특정 검증 손실(3.28)을 가능한 한 가장 짧은 시간에 달성하도록 설계된 GPT-2 (124M)용 고효율 학습 파이프라인을 구현합니다.
작동 방식
이 프로젝트는 다음 세 가지 주요 기술적 최적화를 구현하여 이전 속도 기록을 뛰어넘습니다:
- 읽기 가중치의 Tail EMA: 학습의 최종 단계에서 모델을 평균화하여 정확도를 높이고, 총 학습 스텝을 1300에서 1288로 줄일 수 있게 합니다.
- Lean ReLU²: MLP 활성화의 제곱만 저장하고 역전파 시 입력을 재구성하여 메모리 트래픽을 줄입니다.
- MLP 잔차 최적화: 큰 텐서를 다시 읽는 대신 작은 항등식에서 기울기를 복원하여 메모리 대역폭을 절약합니다.
대상 독자
LLM 학습 효율, GPU 커널 최적화, 그리고 modded-nanogpt 스피드런 챌린지에 참여하는 연구자 및 엔지니어를 위한 것입니다.
하이라이트
- 74.19~74.6초의 학습 시간을 달성하여 이전 기록을 경신했습니다.
- 8xH100 GPU 간 타이밍 정확도를 보장하기 위해 페어링된 심판 시스템을 사용합니다.
- 최대 성능을 위해 PyTorch 2.10, Flash-Attention 3, Triton 3.6을 활용합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트