qibin0506/Cortex
从零构建大模型:从预训练到RLHF的完整实践
何を解決するか
Cortexは、大規模言語モデル(LLM)をゼロから構築するための完全なオープンソースパイプラインを提供し、個人開発者にとってアクセスしやすく、トレーニングコストとハードウェア要件を最小限に抑えるように設計されています。
動作方法
このプロジェクトは、4つの順次段階に分けられたフルライフサイクルトレーニングフローを実装しています:
- 事前学習:短いコンテキスト窓で基本的な知識を学習。
- 中間学習:モデルをより長いテキストコンテキストに適応。
- 教師あり微調整(SFT):モデルに会話機能を付与。
- 好みの整合:直接好み最適化(DPO)または近接方策最適化(PPO)を使用。PPO段階では「LLM as Judge(LLMを審査者として)」アプローチを採用し、外部のLLMが強化学習の報酬信号を提供します。
技術的には、合計0.1Bパラメータ(推論時約67Mのアクティブパラメータ)の軽量なMixture-of-Experts(MoE)アーキテクチャを使用し、低消費電力デバイスでも高いスループットを実現します。
対象ユーザー
大規模な産業用コンピューティングリソースを必要とせずに、事前学習からRLHFまでを一貫して実践したい個人開発者や研究者。
特徴
- フルスタックオープンソース:事前学習、中間学習、SFT、DPO、PPOのすべてのトレーニングコードを100%提供。
- 超軽量MoE:低エンドハードウェアでも極めて効率的な0.1Bパラメータモデル。
- LLM-as-Judge PPO:外部LLMを報酬モデルとして統合し、高品質な整合トレーニングを実現。
- 思考制御:
/thinkおよび/no thinkタグをサポートし、モデルの推論モードを切り替え可能。 - ハードウェアの適応性:中国国内のチップ(MLU370)でも成功裏にテスト・トレーニング済み。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト