Human 피드백을 이용한 요약 학습
OpenAI는 텍스트 요약을 위한 언어 모델을 훈련시키기 위해 인간 피드백 기반 강화 학습(RLHF)을 적용했으며, 이 접근 방식이 표준 지도 학습보다 요약 품질을 크게 향상시킨다는 것을 발견했습니다. 연구자들은 인간 피드백을 받은 13억 파라미터 모델이 지도 학습만으로 훈련된 120억 파라미터 모델보다 성능이 더 우수함을 입증했습니다.
요약에서 RLHF가 모델 스케일링을 능가함
인간 피드백 기반 강화 학습은 단순히 모델 크기를 늘리거나 지도 미세 조정에 의존하는 것보다 고품질 요약을 위한 더 효과적인 경로를 제공합니다. 비교 평가에서, 1.3B 및 6.7B 인간 피드백 모델의 요약이 Reddit 데이터셋의 원본 인간 작성 "TL;DR" 요약보다 인간 라벨러에게 더 선호되었습니다.
라벨러는 더 긴 요약을 선호하는 경향이 있었는데, 이로 인해 모델은 허용 가능한 최대 길이에 수렴하게 되었습니다. 길이를 통제했을 때도 6.7B 모델의 요약 선호도는 약간 감소했을 뿐(70%에서 65%로), 이는 품질 향상이 주로 요약 길이 때문이 아님을 나타냅니다.
뉴스 데이터셋으로의 일반화 및 전이
Reddit TL;DR 데이터셋에서 훈련된 모델은 추가적인 미세 조정 없이 다른 도메인으로 효과적으로 전이됩니다. CNN/DailyMail 뉴스 데이터셋에 적용했을 때—which contains articles more than twice as long as Reddit posts and uses a different writing style—the human feedback models generated high-quality short summaries.
길이를 통제했을 때, 6.7B 인간 피드백 모델이 생성한 요약은 CNN/DM 데이터셋의 인간 작성 참조 요약보다 높은 평가를 받았습니다. 이는 RLHF 과정이 모델이 요약의 일반적인 원리를 학습하도록 돕는 것이며, 단지 훈련 데이터의 특정 스타일을 모방하는 것이 아님을 시사합니다.
RLHF의 기술적 접근
훈련 과정은 네 가지 주요 단계로 구성됩니다:
- 초기 모델 훈련: GPT 스타일 트랜스포머 모델(1.3B 및 6.7B 파라미터)은 먼저 지도 학습을 통해 인간 작성 TL;DRs를 예측하도록 미세 조정됩니다.
- 인간 비교 데이터 수집: 인간은 동일한 게시물의 두 가지不同的 요약을 비교하고 선호하는 버전을 선택합니다. 주요 모델은 약 65,000개의 비교를 기반으로 훈련되었지만, 효과적인 결과는 최소 8,000개에서도 나타났습니다.
- 보상 모델 훈련: 인간 선호도를 예측하도록 보상 모델이 훈련되며, (게시물, 요약) 쌍을 보상 값에 매핑합니다.
- RL 미세 조정: 요약 정책은 1백만 에피소드 동안 Proximal Policy Optimization(PPO)을 사용하여 보상 모델에 대해 최적화됩니다. KL 페널티가 사용되어 정책이 초기 지도 모델에 가깝게 유지되도록 합니다.
데이터 품질 및 보상 최적화
저품질 라벨로부터 모델이 평균적인 행동을 학습하는 문제를 방지하기 위해 OpenAI는 엄격한 데이터 품질 관리 조치를 시행했습니다:
- 계약자 관리: 크라우드소싱 대신 OpenAI는 약 80명의 계약자를 시간당 급여로 고용하여 온보딩 및 채팅과 화상 통화를 통한 직접적인 소통을 포함한 실질적인 관계를 유지했습니다.
- 합의 모니터링: 연구자들은 자신의 판단과 라벨러의 판단 간의 합의율을 면밀히 모니터링했습니다.
- 최적화 강도: 팀은 보상 모델에 과도하게 최적화하면 결국 성능이 저하된다는 것을 발견했습니다. 최고의 샘플은 데이터셋의 참조 요약에서 99번째 백분위수 정도의 예측 보상을 가진 것으로 나타났습니다.
한계 및 컴퓨팅 요구사항
성능 향상에도 불구하고 연구자들은 몇 가지 중요한 한계를 식별했습니다:
- 행동 정의: RLHF는 정의된 행동에 최적화되지만 그 행동이 무엇이어야 하는지를 결정하지는 않습니다. 복잡한 작업에 대해서는 영향을 받는 집단을 "좋은" 행동의 정의에 포함시키는 것을 연구자들은 제안합니다.
- 데이터셋 편향: Reddit TL;DR 데이터셋이 최소한으로만 관리된 콘텐츠를 포함하기 때문에, 모델은 공격적이거나 해로운 사회적 편견을 반영하는 요약을 생성할 수 있습니다.
- 컴퓨팅 비용: 보상 모델과 정책의 확장은 자원을 많이 소모하며; 6.7B 모델의 미세 조정에 약 320 GPU-일이 필요했습니다.
- 성능 격차: 모델은 아직 절대적인 인간 수준 성능에 도달하지 못했습니다. 정확도, 적용 범위, 일관성을 기준으로 한 7점 척도에서 모델은 전체 점수가 완벽한 경우를 45%의 시간 동안 보였으며, 참조 요약은 23%였습니다.
미래 방향
OpenAI는 인간이 평가하기 어려운 작업, 예를 들어 광범위한 연구가 필요한 질문에 대한 검증에 인간 피드백을 확장하는 것을 목표로 합니다. 제안된 솔루션으로는 인간이 출력을 더 정확하게 평가하도록 돕는 ML 기반 도구 개발이 포함됩니다. 또한, 연구소는 이진 비교를 넘어 인간 시연, 모델 출력에 대한 직접 편집, 선호도에 대한 상세한 설명과 같은 피드백 유형을 탐구하고 있습니다.