OpenAI 모델 안전을 위한 규칙 기반 보상
OpenAI는 규칙 기반 보상(RBRs)이라는 새로운 정렬 방법을 개발했으며, 이를 통해 AI 모델이 방대한 인간 데이터 수집 없이도 안전하게 행동할 수 있습니다. 인간 피드백을 명확하고 프로그래밍 가능한 규칙으로 대체하거나 보강함으로써, RBR은 안전 정책을 더 빠르게 업데이트하고 모델의 유용성과 해악 방지 사이의 효율적인 균형을 가능하게 합니다.
규칙 기반 보상의 작동 방식
규칙 기반 보상은 미리 정의된 명제 집합—원하는 또는 원하지 않는 응답 특성을 설명하는 간단한 문장—을 활용하여 모델 출력물을 평가합니다. 이러한 명제들은 규칙으로 결합되어 프롬프트에 적용되는 특정 안전 정책에 따라 응답을 분류합니다.
세 가지 응답 카테고리
요청에 따라 시스템은 프롬프트를 세 가지 원하는 응답 유형 중 하나에 매핑합니다:
- 강경 거부: 범죄적 혐오 발언, 극단주의, 폭력 범죄에 대한 지시 등에 사용됩니다. 이상적인 응답은 간단한 사과와 수행할 수 없다는 진술을 포함하며, 판단적인 언어나 과도한 장황함을 피합니다.
- 부드러운 거부: 자해와 같은 민감한 주제에 사용됩니다. 이상적인 응답은 사용자의 감정 상태를 인정하는 공감적인 사과를 제공하면서도 요청을 거절합니다.
- 수용: 모델이 사용자의 요청을 완전히 이행해야 하는 온건한 요청에 사용됩니다.
기술 구현
자동화된 채점기(고정된 언어 모델)는 명제 준수 여부에 따라 응답을 점수화합니다. 이러한 점수는 알려진 이상적인 응답 유형을 가진 프롬프트의 소규모 데이터셋을 사용해 가중치 파라미터를 학습하는 선형 모델에 적용됩니다.
이러한 RBR 보상은 표준 인간 피드백 기반 강화 학습(RLHF) 파이프라인에 통합됩니다. 구체적으로, 이는 도움이 되는 보상 모델의 보상과 결합되어 근접 정책 최적화(PPO) 알고리즘에서 추가 신호로 사용되어 모델이 안전 정책을 준수하도록 장려합니다.
성능 및 결과
RBR을 사용해 훈련된 모델은 인간 피드백으로 훈련된 모델과 비교해 유사한 안전 성능을 보이며, 다음과 같은 운영상의 장점을 제공합니다:
- 과도한 거부 감소: RBR은 모델이 안전한 요청을 잘못 거부하는 사례를 줄여 모델의 전반적인 유용성을 향상시킵니다.
- 효율성: 이 방법은 방대한 인간 데이터에 대한 의존도를 크게 줄여 훈련 과정을 더 빠르고 비용 효율적으로 만듭니다.
- 민첩성: 규칙을 수정하거나 추가함으로써 안전 지침을 신속하게 업데이트할 수 있으며, 모델을 대규모로 재훈련할 필요가 없습니다.
- 능력 유지: RBR 구현은 일반적인 능력 벤치마크에서의 평가 지표에 부정적인 영향을 주지 않습니다.
제한 사항 및 윤리적 고려사항
RBR은 명확한 규칙이 있는 작업에 효과적이지만, 고품질 에세이 작성과 같은 주관적인 작업에는 덜 적합합니다. 이를 완화하기 위해 OpenAI는 RBR을 인간 피드백과 결합하여, RBR은 특정 가이드라인(예: "속어 사용 금지")에 사용하고 인간 피드백은 일관성 같은 미묘한 품질에 사용합니다.
윤리적 관점에서 안전 검증을 인간에서 AI로 전환하면 인간 감독이 감소하고, 편향된 모델이 RBR 보상을 제공할 경우 편향이 증폭될 수 있습니다. OpenAI는 연구자들이 공정성과 정확성을 보장하도록 RBR을 신중히 설계해야 한다고 강조합니다.
향후 적용
안전 분야를 넘어 OpenAI는 RBR이 명시적인 규칙으로 원하는 행동을 정의할 수 있는 모든 작업에 적용될 수 있다고 제안합니다. 예를 들어 특정 응용 프로그램에 맞게 응답의 성격이나 형식을 맞추는 것이 가능합니다. 향후 연구에서는 RBR 구성 요소를 이해하기 위한 소거 연구, 규칙 개발을 위한 합성 데이터 활용, 다양한 도메인에 걸친 광범위한 인간 평가 등을 포함할 예정입니다.
SUMMARY: OpenAI는 명시적이고 단계적인 규칙을 사용해 AI 안전 행동을 정렬하는 방법인 규칙 기반 보상(RBRs)을 도입했으며, 방대한 인간 데이터 수집이 필요하지 않습니다.
TITLE: OpenAI 모델 안전을 위한 규칙 기반 보상