jingyaogong/minimind
🧠 Train a 64M-parameter LLM from scratch in just 2h!
解决的问题
MiniMind 旨在降低学习大型语言模型(LLM)开发的门槛。它提供了一种方法,使个人能够使用消费级 GPU 从零开始训练一个功能性的超小型语言模型(约 64M 参数),避免了大型模型的“黑箱”特性以及第三方框架的高层抽象。
工作原理
该项目使用原生 PyTorch 实现了完整的 LLM 训练流水线,避免使用高层库抽象以确保透明性。它遵循 Transformer Decoder-Only 架构(与 Qwen3 生态系统对齐),并支持 Dense 和混合专家(MoE)配置。该流水线涵盖了整个生命周期:分词器训练、预训练、监督微调(SFT)、LoRA、RLHF(DPO)、RLAIF(PPO/GRPO/CISPO)、工具使用和模型蒸馏。
适用人群
- 希望通过从零编写和训练代码来理解 LLM 内部机制的 AI 初学者和学生。
- 寻找轻量、可复现的 LLM 实验起点的开发者。
- 硬件资源有限(例如单张 NVIDIA 3090)但希望体验完整训练流程的用户。
亮点
- 超轻量级:最小版本约为 GPT-3 的 1/2700,支持快速训练(单张 3090 上 SFT 可在约 2 小时内完成)。
- 全栈实现:无需依赖高层封装,原生 PyTorch 实现预训练、SFT、RLHF 和 RLAIF。
- 广泛兼容:支持
transformers、llama.cpp、vllm和ollama进行推理。 - 高级功能:支持 MoE、YaRN(用于长文本外推)、代理型 RL(用于工具使用场景)和自适应思维链。
相关
- 项目
- 项目
- 项目
- 项目
- Dispatch