GPT-4의 실수를 GPT-4로 찾기

OpenAI는 GPT-4를 기반으로 한 특화된 모델인 CriticGPT를 개발했으며, 이는 ChatGPT의 코드 출력에서 부정확성을 식별합니다. 이 도구는 Reinforcement Learning from Human Feedback (RLHF) 과정에서 인간 AI 트레이너를 지원하도록 설계되어, 모델이 더욱 고도화됨에 따라 인간이 발견하기 어려운 미묘한 실수를 포착할 수 있게 합니다.

AI 지원 검토를 통한 RLHF 강화

CriticGPT는 RLHF의 근본적인 한계를 해결합니다. AI 모델이 더 많은 지식을 갖추고 오류가 더욱 미묘해짐에 따라 인간 트레이너가 응답을 정확히 평가하기 점점 어려워집니다. 고품질 피드백을 제공하는 인간 능력의 이러한 격차는 고도화된 AI 시스템의 정렬을 방해할 수 있습니다.

CriticGPT를 라벨링 파이프라인에 통합함으로써 OpenAI는 트레이너에게 명시적인 AI 지원을 제공합니다. 실험 환경에서 CriticGPT의 도움을 받은 인간 트레이너는 지원받지 않은 트레이너보다 60%의 비율로 더 높은 성과를 보였습니다. 인간 감독과 AI 비판의 결합은 인간만의 검토보다 더 포괄적인 피드백을 제공하고, 모델만의 검토보다 환각된 버그가 적은 결과를 낳습니다.

교육 방법론 및 성능

CriticGPT는 ChatGPT와 유사하게 RLHF를 사용해 교육되었으며, 오류 탐지에 특별히 초점을 맞추었습니다. 교육 과정은 다음과 같이 진행되었습니다:

  • Manual Error Insertion: AI 트레이너가 ChatGPT가 생성한 코드에 실수를 수동으로 삽입했습니다.
  • Example Feedback: 트레이너가 삽입된 버그를 발견한 것처럼 예시 비판을 작성했습니다.
  • Comparative Rating: 트레이너가 여러 비판을 비교하여 어느 것이 삽입된 버그를 성공적으로 잡았는지 식별했습니다.

“자연 발생” ChatGPT 버그를 포함한 테스트에서 트레이너는 63%의 경우에 표준 ChatGPT 비판보다 CriticGPT의 비판을 선호했습니다. 이러한 선호는 “사소한 지적”(도움되지 않는 작은 불만)과 환각을 더 적게 생성하기 때문입니다.

품질을 더욱 향상시키기 위해 OpenAI는 비판 보상 모델에 대한 추가 테스트 시점 검색을 활용했습니다. 이를 통해 정밀도-재현율 간의 조정 가능한 트레이드오프가 가능해져, 버그 탐지의 공격성과 환각 위험을 균형 있게 조절하여 RLHF에 가장 도움이 되는 비판을 생성할 수 있습니다.

현재 제한 사항

  • Input Length: 모델은 비교적 짧은 ChatGPT 답변을 대상으로 학습되었으며, 향후 에이전트를 감독하려면 길고 복잡한 작업을 처리할 방법이 필요합니다.
  • CURLOPT Hallucinations: 모델은 여전히 환각을 일으키며, 이는 가끔 인간 트레이너가 라벨링 실수를 하게 만들 수 있습니다.
  • Error Distribution: 현재 초점은 단일 위치에서 식별 가능한 오류에 맞춰져 있지만, 실제 오류는 종종 응답의 여러 부분에 퍼져 있습니다.
  • Complexity Ceiling: 매우 복잡한 작업의 경우, 전문가 인간도 AI 어시스턴트도 응답을 정확히 평가하지 못할 수 있습니다.

AI 정렬에 대한 미래 함의

OpenAI는 RLHF 파이프라인 내에서 CriticGPT와 유사한 모델의 활용을 확대할 계획입니다. 이 연구는 GPT‑4에 RLHF를 적용하면 인간이 GPT‑4를 위한 고품질 RLHF 데이터를 생성할 수 있음을 보여주며, 점점 더 복잡해지는 AI 시스템을 정렬하는 데 필수적인 개선의 순환을 만들게 됩니다.

Sources