AI-Hypercomputer/maxtext

A simple, performant, and scalable Jax LLM!

해결하는 문제

MaxText는 대규모 언어 모델(LLM) 학습을 위한 고성능, 확장 가능한 참조 구현체를 제공하도록 설계되었습니다. 단일 호스트부터 Google Cloud TPUs 및 GPU의 대규모 클러스터에 이르기까지 다양한 하드웨어에서 높은 모델 FLOPs 활용도(MFU)와 처리량(초당 토큰 수)을 달성하는 도전 과제를 해결하며, 코드베이스는 간단하고 '최적화 없음' 상태를 유지합니다.

작동 방식

순수한 Python과 JAX로 작성된 MaxText는 XLA 컴파일러를 활용하여 성능을 최적화합니다. Flax(신경망), Tunix(학습 후 최적화), Orbax(체크포인팅), Optax(최적화), Grain(데이터 로딩)과 같은 JAX AI 라이브러리 세트와 통합됩니다. 이 라이브러리는 초기 학습부터 SFT(Supervised Fine-Tuning) 및 강화학습(GRPO 및 GSPO)과 같은 기법을 사용한 확장 가능한 학습 후 최적화까지 지원합니다.

대상 사용자

연구 및 생산 환경에서 대규모 LLM 프로젝트를 구축하는 연구자 및 개발자를 위한 것입니다. 인기 있는 오픈소스 모델을 학습하고 미세조정하기 위해 확장 가능하고 고성능 프레임워크가 필요할 때 적합합니다.

주요 특징

  • 광범위한 모델 지원: Gemma, Llama, DeepSeek, Qwen, Mistral의 참조 구현체를 포함하며, MoE(Mixture of Experts) 및 멀티모달 모델도 지원합니다.
  • 확장성: 수만 개의 칩에서의 초기 학습을 지원합니다.
  • 학습 후 최적화 프레임워크: Tunix를 통해 SFT 및 RL(샘플링에 vLLM 사용)을 위한 확장 가능한 프레임워크 제공.
  • 하드웨어 최적화: 최대 효율성을 위해 Google Cloud TPUs 및 GPU에 특화되어 있습니다.
  • 멀티모달 기능: Gemma 3, Gemma 4 및 Llama 4 VLM의 멀티모달 학습을 지원합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트