AI-Hypercomputer/maxtext
A simple, performant, and scalable Jax LLM!
解決的問題
MaxText 的設計目標是提供一個高性能、可擴展的參考實現,用於訓練大型語言模型(LLMs)。它解決了在從單一主機到 Google Cloud TPUs 和 GPU 的大型叢集等廣泛硬體上實現高模型浮點運算利用率(MFU)和吞吐量(每秒詞元數)的挑戰,同時保持程式碼庫簡單且「無優化」。
如何運作
使用純 Python 和 JAX 寫成,MaxText 借助 XLA 編譯器來優化效能。它整合了一套 JAX AI 庫,包括 Flax(神經網絡)、Tunix(訓練後優化)、Orbax(檢查點)、Optax(優化)和 Grain(資料加載)。該庫支援從零開始的預訓練,以及使用監督微調(SFT)和強化學習(GRPO 和 GSPO)等技術的可擴展訓練後優化。
適用對象
適用於在研究和生產環境中開發雄心勃勃的 LLM 專案的研究人員和開發者,他們需要一個可擴展、高性能的框架來訓練和微調流行的開源模型。
主要特色
- 廣泛的模型支援:包含 Gemma、Llama、DeepSeek、Qwen 和 Mistral 的參考實現,包括 MoE(專家混合)和多模態模型。
- 可擴展性:支援在數萬個晶片上進行預訓練。
- 訓練後優化框架:透過 Tunix 提供可擴展的框架,支援 SFT 和 RL(使用 vLLM 進行採樣)。
- 硬體優化:專為 Google Cloud TPUs 和 GPU 設計,以達到最大效率。
- 多模態功能:支援 Gemma 3、Gemma 4 和 Llama 4 VLM 的多模態訓練。
"MaxText 提供了一個高效、可擴展的框架,讓研究人員能快速在大型模型上進行實驗。" — @maxtext-team
相關
- 專案
- 專案
- 專案
- 專案
- 專案