lucidrains/PaLM-rlhf-pytorch
Implementation of RLHF (Reinforcement Learning with Human Feedback) on top of the PaLM architecture. Basically ChatGPT but with PaLM
What it solves
이 프로젝트는 PaLM 아키텍처를 사용하는 Reinforcement Learning from Human Feedback (RLHF)의 PyTorch 구현체를 제공합니다. 개발자가 인간이 큐레이션한 피드백을 바탕으로 보상 모델(reward model)을 학습시키고, 강화 학습을 통해 모델의 출력을 최적화함으로써 사전 학습된 언어 모델을 인간의 선호도에 맞게 정렬할 수 있도록 합니다.
How it works
프로세스는 크게 세 가지 단계로 나뉩니다:
Base Model Training:
PaLMtransformer를 표준적인 자기회귀 모델로 학습시킵니다.Reward Model Training: 주어진 시퀀스에 대한 인간의 평가를 예측하기 위해
RewardModel을 생성합니다 (선택적으로 효율적인 미세 조정을 위해 LoRA를 사용할 수 있습니다).RLHF Optimization:
RLHFTrainer는 사전 학습된 PaLM 모델과 보상 모델을 모두 사용하여 강화 학습 에피소드를 통해 언어 모델의 생성 능력을 정교화합니다.
Who it’s for
ChatGPT와 같은 모델에서 사용되는 RLHF 파이프라인을 PaLM 아키텍처의 오픈 소스 구현을 사용하여 재현하고자 하는 AI 연구자 및 개발자를 위해 설계되었습니다.
Highlights
- LoRA Support: 과적합을 방지하기 위해 Low-Rank Adaptation (LoRA)을 사용하여 보상 모델을 미세 조정하는 옵션을 포함합니다.
- Flash Attention: 더 빠르고 메모리 효율적인 어텐션 메커니즘을 위해 통합되었습니다.
- Complete Pipeline: 베이스 transformer 학습부터 보상 모델링 및 최종 RLHF 학습까지 구조화된 워크플로우를 제공합니다.
관련
- Dispatch
- 프로젝트
- Dispatch
- 프로젝트