OpenAI InstructGPT: 언어 모델을 지침 준수하도록 정렬하기

OpenAI는 GPT-3보다 사용자의 의도에 더 밀접하게 부합하도록 설계된 언어 모델 세트인 InstructGPT를 개발했습니다. 인간 피드백 기반 강화 학습(RLHF)을 활용하여, InstructGPT는 지침 준수 능력을 향상시키고, 진실성을 높이며, 유해한 콘텐츠 생성을 줄입니다.

향상된 지침 준수 및 안전성

InstructGPT는 영어 지침을 따르고 유용한 출력을 제공하는 데 있어 GPT-3를 크게 능가합니다. GPT-3는 인터넷 텍스트의 대규모 데이터셋에서 다음 단어를 예측하도록 학습되었으며—이로 인해 종종 부정확하거나 유해한 출력이 생성되곤 했습니다—InstructGPT는 사용자가 실제로 원하는 작업을 수행하도록 구체적으로 정렬되었습니다.

주요 성능 향상 사항은 다음과 같습니다:

  • 높은 사용자 선호도: 인간 레이블러는 GPT-3가 "instruction-following mode"에 진입하도록 few-shot 프롬프트를 제공받았음에도 불구하고, InstructGPT의 출력을 GPT-3보다 훨씬 더 선호합니다.
  • 효율적인 규모: 레이블러들은 1.3B 파라미터의 InstructGPT 모델이 175B 파라미터의 GPT-3 모델보다 파라미터 수가 100배 이상 적음에도 불구하고 더 선호했습니다.
  • 유해성 및 허위 정보 감소: RealToxicityPrompts 및 TruthfulQA 벤치마크에 따르면, InstructGPT는 모방형 허위 정보를 덜 생성하며 GPT-3보다 유해성이 낮습니다.
  • 낮은 환각 현상 비율: API 프롬프트 분포에 대한 인간 평가 결과, InstructGPT는 사실을 덜 왜곡하며 더 적절한 응답을 생성합니다.

RLHF 학습 방법론

InstructGPT는 사전 학습된 GPT-3 모델에 이미 존재하는 능력을 "해제"하기 위해 3단계 인간 피드백 기반 강화 학습(RLHF) 프로세스를 사용하여 학습됩니다:

  1. Supervised Fine-Tuning: 레이블러는 API에 제출된 프롬프트에 대해 원하는 모델 동작의 시연을 제공합니다.
  2. Reward Model Training: 레이블러는 여러 모델 출력을 순위 매깁니다. 그리고 인간이 어떤 출력을 선호할지 예측하는 보상 모델(RM)을 학습시킵니다.
  3. PPO Fine-Tuning: GPT-3 정책은 RM이 제공하는 보상 신호를 최대화하기 위해 PPO 알고리즘을 사용하여 미세 조정됩니다.

학술적 NLP 작업에서의 성능이 고객 선호도에 맞추어 정렬됨에 따라 성능이 떨어지는 "alignment tax"를 방지하기 위해, OpenAI는 일반적인 로그 가능도 최대화(normal log likelihood maximization)를 사용하여 원래 GPT-3 사전 학습 데이터의 일부를 RL 미세 조정 프로세스에 혼합했습니다. 이 접근 방식은 안전성과 선호도 정렬을 유지하면서 학술적 벤치마크에서의 성능을 보관하거나 심지어 향상시킵니다.

일반화 및 선호도 정렬

OpenAI는 InstructGPT가 학습 레이블러의 특정 선호도에 과일하게(overfit) 되었는지 테스트했습니다. 실험 결과, 학습에 참여하지 않은 레이블러(held-out labelers)는 학습 레이블러와 동일한 비율로 InstructGPT의 출력을 선호했습니다. 또한, 특정 레이블러의 하위 집합으로 학습된 보상 모델은 다른 하위 집합에도 잘 일반화되었으며, 이는 모델이 특정 주석가 그룹에 국한되지 않고 더 넓은 선호도를 정렬하도록 설계되었음을 시사합니다.

현재의 한계 및 안전성 위험

이러한 발전에도 불구하고, InstructGPT는 완전히 정렬되거나 안전하지 않습니다. OpenAI는 다음과 같은 지속적인 과제를 식별합니다:

  • 잔여 위험: 모델은 명시적인 프롬프트 없이도 여전히 편향되거나, 유해하거나, 성적 또는 폭력적인 콘텐츠를를 생성할 수 있습니다.
  • 오용용의 취약성: 모델이 지침을 더 잘 따르기 때문에, 명시적으로 지시받을 경우 유해한 출력을 생성할 가능성이 더 높을 수 있습니다. 유해한 지침에 대한 신뢰할 수 있는 거부 능력은 여전히 해결해야 할 연구 과문제입니다.
  • 문화적 편향: 모델이 영어 지침으로 학습되었기 때문에, 영어권 인구의 문화적 가치에 편향되어 있습니다.

이러한 위험을 완약화하기 위해, OpenAI는 잠재적인 응용 분야를 지속적으로 검토하고, 유해한 완료를 감지하기 위한 콘텐츠 필터를 제공하며, 오용을 모니터링합니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch