인간 피드백 기반 강화 학습 (RLHF) 설명하기
인간 피드백 기반 강화 학습 (RLHF)은 인간의 선호도를 기반으로 모델을 직접 최적화하기 위해 강화 학습을 사용하여 대규모 언어 모델 (LLMs)을 인간의 가치에 맞게 정렬하는 방법입니다. 이 프로세스를 통해 모델은 단순한 다음 토큰 예측을 넘어 더 유용하고, 진실하며, 안전한 텍스트를 생성할 수 있게 됩니다.
RLHF의 3단계 학습 프로세스
RLHF는 범용 사전 학습 모델을 정렬된 어시스턴트로 변환하는 다단계 학습 파이프라인입니다. 프로세스는 세 가지 핵심 단계로 나뉩니다:
1. 언어 모델 사전 학습
프로세스는 다음 토큰 예측을 위한 cross-entropy loss와 같은 고전적인 목적 함수를 사용하여 사전 학습된 언어 모델로 시작합니다. 초기 모델은 인간이 생성한 "preferable" 텍스트 (OpenAI) 또는 "helpful, honest, and harmless" 기준을 위한 증류된 문맥 단서 (Anthropic)와 같은 증강된 데이터로 미세 조정될 수 있지만, 핵심 요구 사항은 다양한 지시사항에 잘 응답하는 모델입니다.
2. 보상 모델 학습
"좋은" 텍스트에 대한 수학적 손실 함수를 정의하는 것은 다루기 어렵기 때문에, RLHF는 인간의 선호도를 수치적으로 나타내기 위해 보상 모델 (RM)을 사용합니다.
- 목표: RM은 텍스트 시퀀스를 입력받아 스칼라 보상을 반환합니다.
- 데이터 수집: 프롬프트는 데이터셋에서 샘플링되어 초기 LM을 통해 여러 출력을 생성합니다. 그런 다음 인간 주석가(annotators)가 이러한 출력을 순위 매깁니다.
- 순위 매기기 vs 점수 매기기: 인간은 절대적인 스칼라 점수를 제공하기보다는 (종종 Elo 시스템을 사용하여) 일대일 대결 방식(head-to-head matchups)으로 출력을 순위 매깁니다. 순위는 서로 다른 주석가들 사이에서 노이즈가 적고 더 잘 보정되기 때문입니다.
- 모델 용량: 보상 모델의 크기는 다양합니다. 예를 들어, OpenAI는 175B LM을 위해 6B 보상 모델을 사용했고, DeepMind는 LM과 보상 모델 모두에 70B Chinchilla 모델을 사용했습니다.
3. 강화 학습을 통한 미세 조정
마지막 단계에서는 보상 모델의 점수를 기반으로 초기 LM의 복사본을 최적화하기 위해 일반적으로 Proximal Policy Optimization (PPO)와 같은 정책 경사(policy-gradient) RL 알고즘을 사용합니다.
- RL 공식화:
- Policy: 프롬프트를 입력받아 텍스트 시퀀스를 반환하는 LM.
- Action Space: 언어 모델의 어휘집 (일반적으로 ~50k tokens).
- Observation Space: 가능한 입력 토큰 시퀀스의 분포.
- Reward Function: 선호도 모델로부터의 스칼라 보상 ($r_{\theta}$)과 RL 정책과 초기 사전 학습 모델 사이의 Kullback–Leibler (KL) divergence ($r_{\text{KL}}$)에 기반한 페널티의 조합.
- KL 페널티: KL divergence 항은 모델이 원래의 사전 학습 모델로부터 너무 멀어지지 않도록 방지합니다. 이 페널티가 없다면, 모델은 보상 모델을 "속여" 높은 점수를 받게 만드는 엉터리 텍스트(gibberish)를 생성할 수 있습니다.
- 업데이트 규칙: PPO는 그래디언트 업데이트가 학습 과정을 불안정하게 만들지 않도록 보장하는 신뢰 영역(trust region) 최적화 알고리즘으로 사용됩니다.
RLHF를 위한 오픈 소스 도구
여러 PyTorch 기반 저장소(repositories)가 RLHF를 구현하는 데 필요한 인프라를 제공합니다:
- TRL (Transformers Reinforcement Learning): Hugging Face 생태계에서 PPO를 사용하여 사전 학습된 LM을 미세 조정하도록 설계되었습니다.
- TRLX: CarperAI가 더 큰 모델 (최대 33B 파라미터, 향후 200B 지원 예정)을 온라인 및 오프라인 학습을 위해 처리할 수 있도록 구축한 TRL의 확장된 포크(fork)입니다. PPO와 Implicit Language Q-Learning (ILQL)을 지원합니다.
- RL4LMs: AllenAI에서 제공하는 라이브러리로, 다양한 RL 알고리즘 (PPO, NLPO, A2C, TRPO) 및 보상 함수를 위한 빌딩 블록을 제공하며, 2,000번의 실험을 통해 벤치마크를 거쳤습니다.
현재의 한계점 및 향후 방향
ChatGPT와 같은 모델에서의 성공에도 불구하고, RLHF는 몇 가지 시스템적 과제를 안고 있습니다:
- 데이터 비용 및 품질: 인간의 선호도 데이터를 수집하는 것은 비용이 매우 많이 듭니다. 고품질의 인간 생성 텍스트는 전문 인력이 필요하며, 인간 주석가들은 종종 의견이 일치하지 않아 학습 데이터에 변동성을 유도합니다.
- 모델의 불완전성: RLHF로 미세 조정된 모델은 불확실성을 표현하지 않고도 해로운 하거나 사실적으로 부정확한 텍스트를 생성할 수 있습니다.
- 최적화 기회: PPO는 오래된 알고리즘이며, 아직 탐구되지 않은 설계 공간이 상당히 큽니다. 잠재적인 개선 사항으로는 학습 중 보상 모델의 비용이 많이 드는 순방향 패스(forward passes)를 피하기 위해 오프라인 RL (예: ILQL)을 사용하거나, 탐색-활용(exploration-exploitation)의 균형을 다르게 탐색하는 것이 포함됩니다.