qibin0506/Cortex

从零构建大模型:从预训练到RLHF的完整实践

해결하는 문제

Cortex는 대규모 언어 모델(LLM)을 처음부터 구축하기 위한 완전한 오픈소스 파이프라인을 제공하며, 훈련 비용과 하드웨어 요구 사항을 최소화하여 개인 개발자도 접근할 수 있도록 설계되었습니다.

작동 방식

이 프로젝트는 네 가지 순차적 단계로 나누어진 전체 라이프사이클 훈련 흐름을 구현합니다:

  1. 사전 훈련: 짧은 컨텍스트 창을 사용하여 기본 지식을 학습합니다.
  2. 중간 훈련: 모델을 더 긴 텍스트 컨텍스트에 적응시킵니다.
  3. 감독형 미세조정(SFT): 모델에 대화 기능을 부여합니다.
  4. 선호도 정렬: 직접 선호도 최적화(DPO) 또는 근접 정책 최적화(PPO)를 사용합니다. PPO 단계는 "LLM as Judge" 방식을 활용하며, 외부 LLM이 강화 학습을 위한 보상 신호를 제공합니다.

기술적으로는 총 0.1B 파라미터(추론 시 약 67M 활성 파라미터)의 가벼운 믹스처 오브 에이전츠(MoE) 아키텍처를 사용하여 저전력 장치에서도 높은 처리량을 보장합니다.

대상 사용자

거대한 산업용 컴퓨팅 자원 없이도 사전 훈련에서 RLHF까지 전체 LLM 생성 과정을 경험하고 싶은 개인 개발자 및 연구자.

주요 특징

  • 풀스택 오픈소스: 사전 훈련, 중간 훈련, SFT, DPO, PPO의 모든 훈련 코드를 100% 제공합니다.
  • 초경량 MoE: 저사양 하드웨어에서도 극도로 효율적인 0.1B 파라미터 모델.
  • LLM as Judge PPO: 외부 LLM을 보상 모델로 통합하여 더 높은 품질의 정렬 훈련을 가능하게 합니다.
  • 사고 제어: /think/no think 태그를 지원하여 모델의 추론 모드를 전환할 수 있습니다.
  • 하드웨어 적응성: 중국 내 수입 칩(MLU370)에서도 성공적으로 테스트 및 훈련 완료.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트