AI-Hypercomputer/maxtext
A simple, performant, and scalable Jax LLM!
What it solves
MaxText 提供了一個高性能、可擴展的參考實現,用於訓練大型語言模型 (LLMs)。它透過利用 JAX 和 XLA 編譯器來實現單機和大規模集群(多達數萬個晶片)的高模型 FLOPs 利用率 (MFU) 和吞吐量,從而消除了對複雜手動優化的需求。
How it works
MaxText 使用純 Python 和 JAX 編寫,針對 Google Cloud TPUs 和 GPUs。它整合了一套 JAX AI 函式庫以提供完整的訓練棧:用於神經網路的 Flax,用於訓練後處理的 Tunix,用於檢查點存儲的 Orbax,用於優化的 Optax,以及用於數據加載的 Grain。它支持從頭開始的預訓練以及使用監督式微調 (SFT) 和強化學習 (GRPO 和 GSPO) 等技術進行的可擴展訓練後處理。
Who it’s for
它是為 AI 研究人員和生產工程師設計的,這些研究人員和工程師正在構建宏大的 LLM 項目,並需要一個高性能的起點,用於實驗、構思和大規模模型訓練。
Highlights
- Broad Model Support: 包括 Gemma, Llama, DeepSeek, Qwen, Mistral, 和 GPT-OSS 的參考實現。
- Scalable Training: 支持在大型集群上進行預訓練,並透過 Tunix 進行可擴展的訓練後處理。
- ** Multi-modal Capability**: 支持 Gemma 3, Gemma 4, 和 Llama 4 VLMs 等多模態模型的訓練。
- Optimization-Free: 透過 JAX 和 XLA 自動實現高效率和吞吐量。
- Decoupled Mode: 可以在沒有 Google Cloud Platform (GCP) 依賴的情況下運行。