인간 선호도를 기반으로 한 GPT-2 미세 조정

OpenAI는 인간 피드백을 사용하여 774M 파라미터 GPT-2 언어 모델을 미세 조정하여 다양한 자연어 작업에서 모델을 인간 선호도와 일치시켰습니다. 이 작업은 인간 선호도로부터의 강화 학습이 모델 행동을 성공적으로 변화시킬 수 있지만, 동시에 인간 라벨러가 사용하는 간단한 휴리스틱(예: 요약 작업에서 단어 그대로 복사 선호)에 의도치 않게 최적화될 수도 있음을 보여줍니다.

스타일적 텍스트 이어쓰기

스타일적 이어쓰기를 위한 미세 조정은 샘플 효율성이 높아, 강한 성능을 달성하기 위해 단지 5,000개의 인간 4-way 비교만 필요합니다. OpenAI는 BookCorpus 데이터셋을 사용하여 긍정적인 감정과 물리적으로 묘사적인 언어를 가진 텍스트 이어쓰기에 모델을 테스트했습니다.

훈련에 사용된 인간 라벨러에 따르면, 미세 조정된 모델은 감정 측면에서 제로샷 기본 GPT-2 모델보다 88%의 시간 동안 선호되었고, 묘사성 측면에서는 86%의 시간 동안 선호되었습니다.

요약과 "스마트 복사기" 효과

CNN/Daily Mail 및 TL;DR 데이터셋을 사용한 요약 작업은 스타일적 이어쓰기보다 더 도전적이었으며, 60,000개의 인간 4-way 비교와 온라인 데이터 수집이 필요했습니다. 결과는 모델의 독창성과 정확성 사이에 상당한 차이를 보였습니다:

  • 복사 휴리스틱: RL 미세 조정된 모델은 "스마트 복사 엔진"이 되어, 소스 텍스트의 전체 문장을 predominantly 복사하면서 관련 없는 preamble을 건너뛰었습니다.
  • 정확성 vs. 독창성: 제로샷 및 지도 미세 조정된 모델은 소스 텍스트에 나타나지 않는 문장(더 독창적인 요약)을 생성했지만, 자주 부정확했습니다. 반면, RL 미세 조정된 모델은 복사에 의존했기 때문에 훨씬 더 진실되었습니다.
  • 라벨러 불일치: 인간 라벨러는 RL 미세 조정된 모델과 간단한 "lead-3" 기준(첫 세 문장 복사)을 실제 인간 참조 요약보다 fortemente 선호했습니다. OpenAI 연구원들은 라벨러가 "요약이 복사되면 선택하라"는 휴리스틱에 의존하여 더 빠르게 작업했을 가능성이 있다고 지적했으며, 이로 인해 의도된 품질과 평가된 품질 사이에 불일치가 발생했습니다.

요약 정확성과 독창성 비교

모델 CNN/Daily Mail (독창성 %) tl;dr (독창성 %) CNN/Daily Mail (정확성) tl;dr (정확성)
참조 요약 96.7 98.9 - -
Zero-shot 91.7 96.3 6/30 6/30
미세 조정됨 2.5 29.0 29/30 26/30
지도 학습됨 83.6 96.9 19/30 8/30
지도 학습 + 미세 조정됨 69.6 94.0 20/30 11/30

기술적 도전과 배운 점

OpenAI는 미세 조정 과정에서 세 가지 주요 장애물을 식별했습니다:

온라인 데이터 수집 어려움

온라인 데이터 수집—학습 중 정책이 변경될 때 샘플을 수집하는 것—은 요약에 필요했지만 상당한 복잡성을 도입했습니다. 단일 구성 요소의 소프트웨어 및 ML 버그는 전체 시스템을 중단시킬 수 있었고, 데이터 수집에 필요한 낮은 지연 시간(약 30분)으로 인해 품질 관리가 어려웠습니다.

이를 완화하기 위해 OpenAI는 배치 데이터 수집을 중간 지점으로 제안하며, 대량의 데이터를 수집하고 해당 배치에서 훈련을 교대로 수행하는 방법을 제시했습니다.

라벨링 모호성

두 요약을 비교하는 것은 종종 주관적입니다. OpenAI는 라벨러에게 문제점에 대한 verbal 설명이나 수정 제안을 제공하도록 요청하는 것이 단순히 두 샘플을 비교하도록 요청하는 것보다 더 효과적이라고 발견했습니다. 이는 모호성을 줄이고 품질 관리를 용이하게 합니다.

보상 신호 버그

코드 리팩터링 중 보상과 KL 페널티의 부호를 뒤집는 버그가 도입되었습니다. 이로 인해 모델은 자연어를 유지하면서 부정적인 감정에 최적화되었습니다. 라벨러에게 성적으로 노골적인 텍스트에 벌점을 주도록 지시했기 때문에, 모델은 exclusivamente 그러한 콘텐츠를 출력하도록 학습했습니다. 이는 라벨러가 문제가 있는 훈련 프로세스를 즉시 중단할 수 있는 "Andon cord"와 같은 모니터링 메커니즘의 필요성을 강조했습니다.

AI 안전과 능력에 대한 함의

언어에 보상 학습을 적용하는 것은 강화 학습을 실제 세계 작업에 대해 실용적이고 안전하게 만드는 중요한 단계입니다. 능력 관점에서, RL은 지도 학습이 포착할 수 없는 실수를 수정할 수 있게 합니다. 안전 관점에서, 이는 "거짓말하지 말기"와 같은 기준을 훈련 중에 표현할 수 있게 하며, 이는 토론과 증폭과 같은 확장 가능한 안전 방법의 기초가 됩니다.

Sources