AI-Hypercomputer/maxtext

A simple, performant, and scalable Jax LLM!

它解决了什么问题

MaxText 旨在提供一个高性能、可扩展的参考实现,用于训练大型语言模型(LLMs)。它解决了在从单个主机到大规模 Google Cloud TPUs 和 GPU 集群的广泛硬件上实现高模型浮点运算利用率(MFU)和吞吐量(每秒 token 数)的挑战,同时保持代码库简单且无需优化。

它如何工作

使用纯 Python 和 JAX 编写,MaxText 利用 XLA 编译器来优化性能。它集成了 Flax(神经网络)、Tunix(训练后优化)、Orbax(检查点)、Optax(优化)和 Grain(数据加载)等一系列 JAX AI 库。该库支持从零开始的预训练以及使用监督微调(SFT)和强化学习(GRPO 和 GSPO)等技术的可扩展训练后优化。

适合谁使用

适用于在研究和生产环境中构建雄心勃勃的 LLM 项目的研究人员和开发者,他们需要一个可扩展、高性能的框架来训练和微调流行的开源模型。

主要亮点

  • 广泛的模型支持:包含 Gemma、Llama、DeepSeek、Qwen 和 Mistral 的参考实现,包括 MoE(专家混合)和多模态模型。
  • 可扩展性:支持在多达数万个芯片上进行预训练。
  • 训练后优化框架:通过 Tunix 提供可扩展的框架,支持 SFT 和 RL(使用 vLLM 进行采样)。
  • 硬件优化:专门针对 Google Cloud TPUs 和 GPU 进行优化,以实现最大效率。
  • 多模态能力:支持 Gemma 3、Gemma 4 和 Llama 4 VLM 的多模态训练。

"MaxText 提供了一个清晰、高效且可扩展的框架,使研究人员能够专注于模型创新,而不是基础设施细节。" — @handle

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目