qibin0506/Cortex
从零构建大模型:从预训练到RLHF的完整实践
解决的问题
Cortex 提供了一个完整的开源管道,用于从零开始构建大型语言模型(LLM),特别针对个人开发者设计,最大限度地降低训练成本和硬件要求。
工作原理
该项目实现了四个顺序阶段的完整生命周期训练流程:
- 预训练:使用短上下文窗口学习基础知识。
- 中段训练:将模型适应更长的文本上下文。
- 监督微调(SFT):赋予模型对话能力。
- 偏好对齐:使用直接偏好优化(DPO)或近端策略优化(PPO)。PPO 阶段采用「LLM 作为裁判」方法,由外部 LLM 提供强化学习的奖励信号。
技术上,它采用轻量级混合专家(MoE)架构,总参数量仅为 0.1B(推理时约 67M 激活参数),确保在低功耗设备上实现高吞吐量。
适用人群
希望无需依赖大规模工业计算资源,即可完整实践从预训练到 RLHF 的整个 LLM 构建过程的个人开发者和研究人员。
亮点
- 全栈开源:提供预训练、中段训练、SFT、DPO 和 PPO 的 100% 训练代码。
- 超轻量 MoE:专为低功耗硬件设计的 0.1B 参数模型,实现极致效率。
- LLM 作为裁判的 PPO:集成外部 LLM 作为奖励模型,实现更高质量的对齐训练。
- 思维控制:支持
/think和/no think标签,用于切换模型的推理模式。 - 硬件适应性:已在国产芯片(MLU370)上成功测试并完成训练。
相关
- 项目
- 项目
- 项目
- 项目
- 项目