qibin0506/Cortex

从零构建大模型:从预训练到RLHF的完整实践

解决的问题

Cortex 提供了一个完整的开源管道,用于从零开始构建大型语言模型(LLM),特别针对个人开发者设计,最大限度地降低训练成本和硬件要求。

工作原理

该项目实现了四个顺序阶段的完整生命周期训练流程:

  1. 预训练:使用短上下文窗口学习基础知识。
  2. 中段训练:将模型适应更长的文本上下文。
  3. 监督微调(SFT):赋予模型对话能力。
  4. 偏好对齐:使用直接偏好优化(DPO)或近端策略优化(PPO)。PPO 阶段采用「LLM 作为裁判」方法,由外部 LLM 提供强化学习的奖励信号。

技术上,它采用轻量级混合专家(MoE)架构,总参数量仅为 0.1B(推理时约 67M 激活参数),确保在低功耗设备上实现高吞吐量。

适用人群

希望无需依赖大规模工业计算资源,即可完整实践从预训练到 RLHF 的整个 LLM 构建过程的个人开发者和研究人员。

亮点

  • 全栈开源:提供预训练、中段训练、SFT、DPO 和 PPO 的 100% 训练代码。
  • 超轻量 MoE:专为低功耗硬件设计的 0.1B 参数模型,实现极致效率。
  • LLM 作为裁判的 PPO:集成外部 LLM 作为奖励模型,实现更高质量的对齐训练。
  • 思维控制:支持 /think/no think 标签,用于切换模型的推理模式。
  • 硬件适应性:已在国产芯片(MLU370)上成功测试并完成训练。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目