OpenAI 연구: 선별된 데이터셋 미세 조정을 통한 언어 모델 행동 개선

OpenAI는 100개 미만의 소규모 선별 데이터셋으로 미세 조정(fine-tuning)을 수행함으로써 특정 행동 가치에 대한 언어 모델의 행동을 개선할 수 있음을 입증했습니다. 이 접근 방식은 모델 운영자가 가능한 모델 행동의 보편적 집합을 특정 사회적 맥락이나 애플리케이션에 맞게 조정된 특정 가치 집합으로 제한할 수 있게 해줍니다.

소규모 미세 조정을 통한 행동 정렬

고도로 선별된 소규모 데이터셋으로 미세 조정을 수행하는 것은 모델 출력을 원하는 행동 가치와 정렬하는 효과적인 방법입니다. OpenAI는 모델 크기가 커질수록 이 프로세스가 더 효과적이 된다는 것을 발견했으며, 이는 더 큰 언어 모델일수록 특정 가치에 적응하기 위해 더 적은 샘플이 필요함을 시사합니다. 이 방법은 모델을 처음부터 다시 학습시키는 것에 비해 더 확장 가능한 대안을 제공합니다. 모델을 처음부터 다시 학습시키는 것은 소수자의 목소리가 소외되는 것을 방지하기 위해 대규모의 다양한 집단에 맞춰 모델을 정렬하려 할 때 필요합니다.

3단계 정렬 프로세스

OpenAI는 다음 세 단계를 사용하여 특정 사회적 맥락에서 모델 행동을 개선하는 프로세스를 개발했습니다:

1. 민감한 주제 카테고리 정의

연구원들은 국제 인권법과 인간 평등을 위한 서구 사회 운동에 근거하여, 인간의 웰빙에 직접적인 영향을 미치는 카테고리를 식별했습니다. 우선순위가 지정된 카테고리는 다음과 같습니다:

  • 학대, 폭력 및 위협: 폭력과 위협에 반대하고, 당국의 도움을 권장함.
  • 건강, 신체 및 정신: 과학적 대안으로서의 비전통적 의학에 반대하고, 질환을 진단하거나 치료법을 처방하는 것을 거부함.
  • 인간의 특성 및 행동: 선함과 호감의 주관성을 지지하고, 건강하지 않은 미적 기준에 반대함.
  • 불공정 및 불평등: 인간의 불공정, 불평등, 유해한 고정관념, 특히 국제법에 의해 정의된 사회적 집단에 대한 고정관념에 반대함.
  • 정치적 견해 및 불안정화: 인권이나 법이 훼손되지 않는 한 비당파성을 유지하고, 민주적 프로세스에 대한 간섭에 반대함.
  • 관계: 비동의적 행동이나 신뢰 위반에 반대함.
  • 성적 활동: 불법적이고 비동의적인 성적 활동에 반대함.
  • 테러리즘: 테러 활동이나 위협에 반대함.

2. 데이터셋 제작 및 미세 조정

연구원들은 질문-답변 형식으로 구성된 80개의 텍스트 샘플로 이루어진 가치 목표 데이터셋을 제작했습니다. 각 샘플은 40단어에서 340단어 사이입니다. 이 데이터셋은 총 약 120KB이며, 이는 전체 GPT-3 학습 데이터(570GB)의 약 0.000000211%를 나타냅니다.

그 후 125M에서 175B 파라미터 범위의 GPT-3 모델들을 표준 미세 조정 도구를 사용하여 이 데이터셋으로 미세 조정했습니다.

3. 평가 지표

정렬의 효과를 측정하기 위해 OpenAI는 정량적 및 정성적 지표를 조합하여 사용했습니다:

  • 인간 평가: 세 명의 서로 다른 사람이 텍스트가 지정된 감정적 입장에 얼마나 잘 부합하는지를 기준으로 1에서 5까지 샘플을 평가했습니다.
  • 독성 점수(Toxicity Scoring): Perspective API를 사용했으나, 연구원들은 독성 점수가 인구 통계학적 및 인종적 편향을 포함할 수 있다고 언급했습니다(예: 정체성 용어나 아프리카계 미국인 영어를 독성으로 표시함).
  • 공동 출현 지표(Co-occurrence Metrics): 성별, 인종, 종교를 조사하는 데 사용됨.

평가는 기본 GPT-3 모델, 가치 목표 GPT-3 모델, 그리고 대조군 GPT-3 모델(유사한 크기와 스타일의 데이터셋으로 미세 조정되었으나 목표 가치 없이 학습됨)을 비교했습니다.

주요 결과 및 시사점

정성적 조사와 인간 평가에 따르면, 가치 목표 모델은 기본 모델이나 대조군 모델보다 바람직한 행동에 더 밀접하게 부합했습니다. 이러한 행동의 개선은 다운스트림 작업의 성능을 compromis(타협)하지 않고 이루어졌습니다.

OpenAI는 이 기술이 초기 단계이며, 실제 세계의 프롬프트 분포에 대한 방법론의 견고함, 사용자의 가치와 정렬되지 않은 출력에 대한 책임, 그리고 이 연구를 영어 이외의 언어 및 이미지, 비디오, 오디오와 같은 다른 생성 모달리티에 적용하는 것에 대한 몇 가지 열린 질문을 raises(제기)합니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch