Anthropic: RLHF를 통한 유익하고 해롭지 않은 어시스턴트 학습
Anthropic은 선호도 모델링과 인간 피드백 기반 강화 학습(RLHF)을 사용하여 언어 모델을 유익하고 해롭지 않은 어시스턴트로 미세 조정하는 방법을 개발했습니다. 이 정렬 과정은 거의 모든 NLP 평가에서 성능을 향상시키며, 요약 및 Python 코딩과 같은 전문적인 작업을 위한 학습과도 호환됩니다.
RLHF를 통한 모델 정렬 및 성능 향상
인간 피드백 기반 강화 학습(RLHF)은 언어 모델을 인간의 선호도에 맞게 정렬하는 데 사용되며, 특히 유익함과 해롭지 않음이라는 두 가지 목표에 초점을 맞춥니다. 이 정렬 학습은 안전성을 위해 일반적인 능력을 희생하지 않으며, 오히려 거의 모든 NLP 평가에서 성능을 향상시킵니다. 또한, RLHF는 Python 코딩 및 요약과 같은 전문적인 기술 습득과 완전히 호환되므로, 정렬이 높은 수준의 기술적 숙련도와 공존할 수 있음을 나타냅니다.
반복적 온라인 학습 방법론
데이터셋과 모델을 효율적으로 개선하기 위해, Anthropic은 반복적인 온라인 학습 모드를 채택합니다. 이 방식에서는 선호도 모델과 RL 정책이 새로운 인간 피드백 데이터를 사용하여 매주 단위로 업데이트됩니다. 이러한 반복적인 사이클을 통해 모델은 현재 성능과 새로운 인간의 입력을 바탕으로 진화하며, 지속적인 개선의 루프를 생성합니다.
강건성 및 RL 보상 분석
RLHF 학습의 강건성에 대한 연구는 보상과 정책이 시작 지점으로부터 이탈하는 정도 사이의 특정 수학적 관계를 밝혀냈습니다. 구체적으로, RL 보상과 정책 및 초기화 상태 사이의 KL divergence 사이의 제곱근 사이에는 대략적인 선형 관계가 존재합니다.
추가 기술 분석
주요 RLHF 결과 외에도, 연구에는 모델의 안정성과 신뢰성을 보장하기 위한 몇 가지 주변 분석이 포함되어 있습니다:
- Calibration and Objectives: 모델의 신뢰도가 정확도와 어떻게 일치하는지, 그리고 상충하는 목표(예: 유익함 vs 해롭지 않음)가 어떻게 균형을 이루는지에 대한 조사.
- OOD Detection: 모델이 처리할 수 없는 프롬프트를 식별하기 위한 Out-of-Distribution (OOD) 탐지의 사용.
- Human Comparison: 품질과 어조를 벤치마크하기 위해 모델의 출력을 인간 작성자의 출력과 비교.
- Prompt Testing: 일관성과 안전성을 테스트하기 위해 최근 관련 연구에서 파생된 프롬프트를 사용하여 모델을 평가함.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch