인간 피드백을 통한 강화 학습 (RLHF) 설명

Reinforcement Learning from Human Feedback (RLHF) 은 일반 텍스트 코퍼스로 학습된 대형 언어 모델(LLM)을 복잡한 인간의 가치와 선호에 맞추는 방법입니다. 이 과정은 모델이 단순히 다음 토큰을 예측하는 수준을 넘어, 주관적인 인간 기준에 따라 도움이 되거나, 진실되거나, 창의적인 텍스트를 생성하도록 합니다.

RLHF 3단계 프로세스

RLHF는 여러 모델과 구분된 배포 단계가 포함된 다단계 학습 파이프라인입니다. 이 과정은 사전 학습, 보상 모델링, 강화 학습 파인튜닝으로 나뉩니다.

1. 언어 모델 사전 훈련

이 과정은 고전적인 목표를 사용해 사전 학습된 언어 모델으로 시작합니다. 이 기본 모델은 다양한 지시문에 응답할 수 있어야 합니다. 시작점으로 사용된 모델 예시에는 InstructGPT용 작은 버전의 GPT-3, Anthropic 연구용 1천만~520억 파라미터 규모의 트랜스포머 모델, DeepMind의 2800억 파라미터 Gopher 모델 등이 있습니다.

엄격히 필요하지는 않지만, 일부 조직은 증강 데이터를 활용해 기본 모델을 추가로 정제합니다. OpenAI는 "선호되는" 인간이 만든 텍스트에 대해 파인튜닝했으며, Anthropic은 "도움이 되고, 정직하며, 해롭지 않은" 기준을 위한 컨텍스트 단서를 사용해 원본 LM을 증류했습니다.

2. 보상 모델 훈련

보상 모델(RM) 또는 선호 모델은 텍스트 시퀀스를 입력받아 인간 선호를 나타내는 스칼라 보상을 반환하도록 설계됩니다. 이 스칼라 출력은 강화 학습 알고리즘과 통합하는 데 필수적입니다.

데이터 수집 및 순위 매기기 RM을 학습하기 위해 데이터셋에서 프롬프트를 샘플링하고 초기 LM을 통해 여러 텍스트 출력을 생성합니다. 인간 주석자는 이 출력들을 순위 매깁니다. 인간이 직접 스칼라 점수를 매기는 것은 잡음이 많고 보정되지 않기 때문에, Elo 시스템을 활용한 1대1 매치업과 같은 순위가 보다 정규화된 데이터셋을 만드는 데 사용됩니다.

모델 아키텍처 보상 모델은 파인튜닝된 LM이 될 수도 있고, 처음부터 학습된 모델일 수도 있습니다. 예를 들어 Anthropic은 샘플 효율성을 높이기 위해 Preference Model Pretraining(PMP)을 사용했습니다. 보상 모델의 크기는 구현에 따라 다르며, OpenAI는 175B LM에 대해 6B 보상 모델을 사용했고, DeepMind는 LM과 보상 모델 모두에 70B Chinchilla 모델을 사용했습니다.

3. 강화 학습을 이용한 파인튜닝

최종 단계에서는 정책 그래디언트 RL 알고리즘, 일반적으로 Proximal Policy Optimization(PPO)을 사용해 초기 LM의 복제본을 보상 모델의 피드백에 따라 최적화합니다.

The RL Formulation

  • Policy: 프롬프트를 받아 텍스트 시퀀스를 반환하는 언어 모델.
  • Action Space: 언어 모델의 어휘(보통 ~50k 토큰).
  • Observation Space: 가능한 입력 토큰 시퀀스의 분포.
  • Reward Function: 선호 모델의 스칼라 보상($r_{\theta}$)과 정책 이동에 대한 페널티($r_{\text{KL}}$)의 조합.

The KL Divergence Penalty 보상 모델을 "속이는" 무의미한 텍스트 생성(보상 해킹)을 방지하기 위해 Kullback–Leibler(KL) 발산을 기반으로 페널티를 적용합니다. 이는 RL 정책이 초기 사전 학습 모델에서 너무 멀리 이동하는 것을 억제해 출력이 일관성을 유지하도록 합니다.

최종 보상 계산은 다음과 같습니다: $r = r_{\theta} - \lambda r_{\text{KL}}$.

Update Rule PPO는 신뢰 영역 최적화 알고리즘으로 사용되어 그래디언트 업데이트가 학습 과정을 불안정하게 만들지 않도록 합니다. PPO가 일반적이지만, DeepMind는 유사한 설정에 대해 동기식 Advantage Actor-Critic(A2C)을 활용하기도 했습니다.

RLHF를 위한 오픈소스 도구

여러 PyTorch 기반 저장소가 RLHF 구현을 돕습니다:

  • TRL (Transformers Reinforcement Learning): Hugging Face 생태계에서 PPO를 사용해 사전 학습된 LM을 파인튜닝하도록 설계되었습니다.
  • TRLX: CarperAI가 만든 TRL 포크로, 현재 최대 33B 파라미터(향후 200B 목표) 모델을 지원하며 Implicit Language Q-Learning(ILQL)을 지원합니다.
  • RL4LMs: AllenAI에서 제공하는 라이브러리로, 다양한 RL 알고리즘(PPO, NLPO, A2C, TRPO)과 커스터마이징 가능한 보상 함수를 위한 빌딩 블록을 제공합니다.

한계 및 향후 방향

성공에도 불구하고 RLHF는 여러 기술적·운영적 과제에 직면해 있습니다:

  • 데이터 비용: 인간 선호 데이터를 수집하는 데 비용이 많이 듭니다. 고품질 인간 생성 텍스트는 특히 비싸지만, 선호 라벨(~50k 샘플)은 비교적 관리 가능합니다.
  • 인간 변이성: 주석자 간 의견 차이가 빈번해, 명확한 정답이 없는 훈련 데이터에 변동성을 도입합니다.
  • 모델 불완전성: 모델은 여전히 해롭거나 사실과 다른 텍스트를 생성할 수 있으며, 불확실성을 표현하지 않을 수 있습니다.

Potential Improvements 향후 연구는 RL 옵티마이저 개선에 초점을 맞춥니다. 보상 모델은 생성된 텍스트마다 비용이 많이 드는 전방 패스를 필요로 하기 때문에, 오프라인 RL 및 Implicit Language Q-Learning(ILQL)과 같은 알고리즘이 보다 효율적인 정책 옵티마이저로 탐구되고 있습니다.

Sources