mlc-ai/pith-train

Compact and Agent-Native MoE Training System

解決的問題

生產級 MoE(專家混合)訓練框架通常過於複雜,依賴重型編譯擴展和間接設計模式,使得人類與 AI 編碼代理難以修改或優化。PithTrain 提供一個高性能量的訓練系統,其程式碼量緊湊到足以讓代理或人類從頭到尾閱讀,同時維持生產級功能。

如何運作

這是一個面向代理的框架,分為三層:用於訓練迴圈的應用層、用於模型協定與分散式訓練的引擎層,以及用於底層內核的運算元層。它實作 4D 並行策略(流水線、資料、上下文與專家並行),並使用 DualPipeV 排程器實現前向-後向執行與 P2P 通訊的重疊。系統支援 FP8 訓練,並與 DeepGEMM 和 FlashAttention 等函式庫整合。

適用對象

需要訓練 MoE 模型(如 Qwen 或 DeepSeek 架構)的研究人員與開發者,希望使用一個容易導航、修改與擴充的程式碼庫,特別是在使用 AI 編碼助手時。

特色

  • 面向代理的設計:約 11K 行 Python 程式碼的緊湊程式碼庫,極少隱式間接引用。
  • 生產級效能:支援 4D 並行與計算-通訊重疊。
  • FP8 訓練:內建 FP8 線性與量化支援,提升效率。
  • 彈性檢查點:支援可重分片檢查點與轉換為 Hugging Face 格式。

相關

  • Dispatch
  • 專案
  • 專案
  • 專案
  • Dispatch