qibin0506/Cortex
从零构建大模型:从预训练到RLHF的完整实践
解決的問題
Cortex 提供一個完整的開源管道,用於從零開始建構大型語言模型(LLM),特別針對個人開發者設計,最大限度降低訓練成本與硬體需求。
工作原理
此專案實作了四個順序階段的完整生命週期訓練流程:
- 預訓練:使用短上下文視窗學習基礎知識。
- 中段訓練:將模型適應更長的文本上下文。
- 監督式微調(SFT):賦予模型對話能力。
- 偏好對齊:使用直接偏好優化(DPO)或近端策略優化(PPO)。PPO 階段採用「LLM as Judge」方法,由外部 LLM 提供強化學習的獎勵信號。
技術上,它採用輕量級混合專家(MoE)架構,總參數量僅為 0.1B(推理時約 67M 活躍參數),確保在低功耗裝置上實現高吞吐量。
適用對象
希望無需依賴大型工業計算資源,即可完整實踐從預訓練到 RLHF 的整個 LLM 建構過程的個人開發者與研究人員。
亮點
- 全棧開源:提供預訓練、中段訓練、SFT、DPO 和 PPO 的 100% 訓練程式碼。
- 超輕量 MoE:專為低功耗硬體設計的 0.1B 參數模型,實現極致效率。
- LLM 作為裁判的 PPO:整合外部 LLM 作為獎勵模型,實現更高品質的對齊訓練。
- 思考控制:支援
/think和/no think標籤,用於切換模型的推理模式。 - 硬體適應性:已在國產晶片(MLU370)上成功測試並完成訓練。
相關
- 專案
- 專案
- 專案
- 專案
- 專案