qibin0506/Cortex

从零构建大模型:从预训练到RLHF的完整实践

何を解決するか

Cortexは、大規模言語モデル(LLM)をゼロから構築するための完全なオープンソースパイプラインを提供し、個人開発者にとってアクセスしやすく、トレーニングコストとハードウェア要件を最小限に抑えるように設計されています。

動作方法

このプロジェクトは、4つの順次段階に分けられたフルライフサイクルトレーニングフローを実装しています:

  1. 事前学習:短いコンテキスト窓で基本的な知識を学習。
  2. 中間学習:モデルをより長いテキストコンテキストに適応。
  3. 教師あり微調整(SFT):モデルに会話機能を付与。
  4. 好みの整合:直接好み最適化(DPO)または近接方策最適化(PPO)を使用。PPO段階では「LLM as Judge(LLMを審査者として)」アプローチを採用し、外部のLLMが強化学習の報酬信号を提供します。

技術的には、合計0.1Bパラメータ(推論時約67Mのアクティブパラメータ)の軽量なMixture-of-Experts(MoE)アーキテクチャを使用し、低消費電力デバイスでも高いスループットを実現します。

対象ユーザー

大規模な産業用コンピューティングリソースを必要とせずに、事前学習からRLHFまでを一貫して実践したい個人開発者や研究者。

特徴

  • フルスタックオープンソース:事前学習、中間学習、SFT、DPO、PPOのすべてのトレーニングコードを100%提供。
  • 超軽量MoE:低エンドハードウェアでも極めて効率的な0.1Bパラメータモデル。
  • LLM-as-Judge PPO:外部LLMを報酬モデルとして統合し、高品質な整合トレーニングを実現。
  • 思考制御/think および /no think タグをサポートし、モデルの推論モードを切り替え可能。
  • ハードウェアの適応性:中国国内のチップ(MLU370)でも成功裏にテスト・トレーニング済み。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト