ServiceNow/Fast-LLM

Accelerating your LLM training to full speed! Made with ❤️ by ServiceNow Research

해결하는 문제

Fast-LLM은 대규모 언어 모델(LLM)의 학습을 가속화하기 위해 설계되었으며, 1B에서 70B 이상의 파라미터를 가진 모델 학습에 소요되는 시간과 비용을 줄입니다. 대규모 GPU 클러스터에서 거대한 모델을 학습할 때의 확장성과 메모리 효율성 문제를 해결합니다.

작동 방식

PyTorch와 Triton을 기반으로 하며, 정교하게 최적화된 커널과 고급 병렬 처리 기법을 사용하여 처리량을 극대화합니다. 3D 병렬 처리(Data, Tensor, Pipeline 병렬)와 시퀀스 길이 병렬 처리, 그리고 ZeRO-1, 2, 3를 활용한 메모리 최적화를 구현합니다. 또한 혼합 정밀도 학습과 기울기 누적을 지원하여 대규모 배치 처리를 가능하게 합니다.

대상 사용자

Slurm 또는 Kubernetes와 같은 고성능 컴퓨팅 클러스터를 사용하여 대규모 생성형 AI 모델을 처음부터 학습하거나 미세 조정이 필요한 AI 연구 팀 및 실무자에게 적합합니다.

주요 특징

  • 고처리량: 예를 들어, Mistral-7B 학습 시 H100당 9,800 tokens/s를 달성.
  • 확장성: 여러 노드와 GPU 간 분산 학습을 지원하며, 포괄적인 병렬 처리 옵션 제공.
  • 유연성: 일반적인 GPT 유사 아키텍처와 호환되며, 효율적인 드롭 없는 Mixture-of-Experts(MoE) 구현 포함.
  • 사용 편의성: 사전 빌드된 Docker 이미지, YAML 기반 설정, Hugging Face Transformers와의 원활한 통합 제공.

관련

  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트