OpenAI, 인간 피드백을 통한 강화학습 및 InstructGPT를 활용한 정렬 전략 발표

TL;DR

OpenAI는 인간 피드백을 통한 강화학습(RLHF)과 InstructGPT 계열이 배포된 언어 모델을 정렬하는 주요 도구이며, GPT‑3 사전 학습 연산량의 2 % 미만으로 강력한 인간 선호도를 달성했지만, 모델에는 여전히 눈에 띄는 단점이 존재하고 연구실은 점점 더 강력한 모델을 사용해 정렬 연구를 자동화할 계획이라고 발표했습니다.

인간 피드백을 통한 강화학습(RLHF) – 핵심 정렬 기법

OpenAI는 인간 피드백을 통한 강화학습(RLHF)이 현재 배포된 언어 모델을 정렬하는 주요 기법이라고 밝힙니다. GPT‑3와 같은 사전 학습된 모델을 인간이 만든 선호 데이터로 미세 조정함으로써, OpenAI는 InstructGPT라는 모델군을 만들었으며, 이 모델들은 명시적인 지시와 진실성, 공정성, 안전성 같은 암묵적인 의도를 모두 따르도록 훈련됩니다.

InstructGPT의 효율성과 성능

  • 인간 선호도: InstructGPT는 100배 더 큰 사전 학습 모델보다 사용자에게 더 선호됩니다.
  • 연산 비용: InstructGPT를 미세 조정하는 데 **GPT‑3 원래 사전 학습에 필요한 연산량의 < 2 %**만 사용됩니다.
  • 인간 피드백 노력: 미세 조정 과정에는 대략 20,000시간의 인간 피드백이 투입되었습니다.
  • 고객 선호도: 실제로 OpenAI API 고객들은 이미 원시 사전 학습 모델보다 InstructGPT를 더 선호하고 있습니다.

이 결과는 비교적 적은 추가 자원으로도 상당한 정렬 향상을 이룰 수 있음을 보여줍니다.

InstructGPT의 현재 한계

OpenAI는 현재 버전의 InstructGPT가 완전히 정렬된 상태와는 거리가 멀다는 점을 인정합니다. 구체적인 실패 사례는 다음과 같습니다:

  • 간단한 지시를 신뢰성 있게 따르지 못함.
  • 진실성이 일관되지 않음.
  • 해로운 요청을 거부하지 못함.
  • 가끔 편향되거나 유해한 출력을 생성함.
  • 기본 사전 학습 모델에 비해 창의성이 감소함(공개 벤치마크에 포착되지 않은 단점).

연구실은 RLHF에 대한 보다 깊은 과학적 이해와 인간 피드백 품질을 향상시키는 방법을 적극적으로 연구하고 있습니다.

정렬 연구 인프라스트럭처

OpenAI의 자연어 API는 정렬 실험을 위한 피드백 루프 역할을 하며, 고객이 실제로 비용을 지불하는 다양한 실세계 작업에 모델을 노출합니다. 이 환경은 정렬 기법을 실전에서 빠르게 평가할 수 있게 합니다.

현재 모델을 넘어선 정렬 확장

  • AGI 정렬과의 구분: API 정렬은 인공지능 일반(AGI) 정렬보다 쉽습니다. 작업이 인간이 감독 가능하고 모델이 인간보다 똑똑하지 않기 때문입니다.
  • RLHF의 역할: RLHF만으로는 AGI 정렬을 해결하기 어렵지만, 확장 가능한 정렬 제안의 핵심 구성 요소로 간주됩니다.
  • 무한히 확장 가능한 해결책은 아직 없음: OpenAI는 영원히 확장 가능한 정렬 방법이 아직 발견되지 않았으며, AI 능력이 성장함에 따라 새로운 정렬 과제가 등장할 것으로 예상한다고 언급합니다.

실용적인 로드맵: AI‑지원 정렬 연구

OpenAI는 실용적인 접근법을 제안합니다:

  1. 인간보다 빠르게 정렬 연구를 가속화하는 시스템을 구축한다.
  2. AI 시스템이 더 많은 정렬 작업을 담당하도록 하여, 궁극적으로 새로운 정렬 기법을 구상·구현·평가하게 만든다.
  3. 인간의 노력을 AI가 만든 정렬 작업을 검토하는 데 집중하고, 직접 생산하는 일은 최소화한다.
  4. 관련 분야에서 인간 수준의 역량을 가진 좁은 AI 시스템을 목표로 삼는다. 이러한 시스템은 범용 또는 초인적 시스템보다 정렬이 더 쉬울 것으로 기대된다.

언어 모델이 정렬 자동화에 적합한 이유

  • 인터넷 텍스트에서 인간 가치에 대한 방대한 지식을 보유하고 있다.
  • 독립적인 에이전트가 아니며 자율 목표를 추구하지 않는다.
  • 정렬 작업을 자연어 혹은 코딩 문제 형태로 표현할 수 있어 모델의 강점에 부합한다.

미래 정렬 보조 도구

OpenAI는 향후 버전의 WebGPT, InstructGPT, Codex정렬 연구 보조 도구 역할을 할 수 있다고 언급하지만, 아직 의미 있는 기여를 할 만큼 충분히 능력이 갖춰지지는 않았다고 밝혔습니다. 연구실은 정렬 연구에 유용한 모델을 훈련시키고, 충분한 역량에 도달하면 외부 정렬 커뮤니티에 제공할 계획입니다.


이 게시물은 OpenAI가 2022년 8월에 발표한 정렬 연구 전략을 충실히 반영하며, 원문을 넘어서는 추가나 추론을 포함하지 않습니다.

Sources