mlc-ai/pith-train

Compact and Agent-Native MoE Training System

解决的问题

生产级 MoE(专家混合)训练框架通常过于复杂,依赖重型编译扩展和间接设计模式,使得人类和 AI 编码代理难以修改或优化。PithTrain 提供了一个高性能的训练系统,代码量紧凑到足以让代理或人类从头到尾阅读,同时保持生产级能力。

如何工作

这是一个面向代理的框架,分为三层:用于训练循环的应用层、用于模型协议和分布式训练的引擎层,以及用于低级内核的算子层。它实现了 4D 并行策略(流水线、数据、上下文和专家并行),并使用 DualPipeV 调度器实现前向-后向执行与 P2P 通信的重叠。系统支持 FP8 训练,并与 DeepGEMM 和 FlashAttention 等库集成。

适用人群

需要训练 MoE 模型(如 Qwen 或 DeepSeek 架构)的研究人员和开发者,希望使用一个易于导航、修改和扩展的代码库,尤其是在使用 AI 编码助手时。

亮点

  • 面向代理的设计:约 11K 行 Python 代码的紧凑代码库,极少隐式间接引用。
  • 生产级性能:支持 4D 并行和计算-通信重叠。
  • FP8 训练:内置 FP8 线性和量化支持,提升效率。
  • 灵活的检查点:支持可重分片检查点和转换为 Hugging Face 格式。

相关

  • Dispatch
  • 项目
  • 项目
  • 项目
  • Dispatch