OpenAI, 인간 피드백을 이용한 책 요약 (2021)

접근법: 인간 피드백으로부터의 강화 학습과 재귀적 작업 분해

OpenAI의 방법은 인간 피드백으로부터의 강화 학습을 사용하여 모델을 훈련시킵니다. 이 모델은 먼저 책의 작은 섹션을 요약하고, 그 요약들을 더 높은 수준의 요약으로 재귀적으로 요약하여 책을 요약합니다. 게시물에 따르면, '우리 모델은 먼저 책의 작은 섹션을 요약하고, 그 요약들을 더 높은 수준의 요약으로 요약하는 방식으로 작동하며, 이와 같은 과정을 반복합니다.'

동기: 정렬 문제를 위한 인간 감독의 확장

이 작업은 인간 평가가 어려운 작업, 예를 들어 책 요약에 대해 확장 가능한 감독 기술을 개발함으로써 정렬 문제를 해결합니다. 게시물은 설명합니다, '미래에 강력한 범용 인공지능을 안전하게 배포하기 위해서는 머신러닝 모델이 인간 의도에 따라 행동하도록 보장해야 합니다. 이 도전 과제는 _정렬 문제_라고 알려져 있습니다.'

방법론: RLHF와 재귀적 분해 결합

이 접근법은 인간 피드백으로부터의 강화 학습을 통합하여 모델 출력을 인간 선호도에 맞춥니다. 그리고 이를 책의 섹션 전반에 계층적으로 적용합니다. 게시물에 따르면, 그들은 이 기술을 사용하여 전체 책을 요약하는 모델을 훈련시켰습니다.

예시: 고전 책에 대한 시연

게시물은 Alice in Wonderland, Pride and Prejudice, Romeo and Juliet, Twelve Years a Slave, 그리고 The Story of My Life와 같은 책들의 샘플 요약을 보여줍니다. 여기서 Alice in Wonderland의 원본 텍스트는 참조용으로 제공됩니다. 책 표지 이미지와 캐러셀 내비게이션을 통해 독자들은 요약을 볼 수 있습니다.

시사점: 확장 가능한 AI 정렬을 향하여

긴 텍스트에 대한 효과적인 요약을 시연함으로써, 이 방법은 다른 복잡하고 평가하기 어려운 작업에 대해 AI 시스템을 정렬할 수 있는 경로를 보여줍니다. 게시물은 이와 같은 확장 가능한 감독 기술이 미래의 범용 AI 시스템의 정렬을 개선할 수 있다고 제안합니다.

Sources