OpenAI가 소개하는 ChatGPT
OpenAI는 대화 형식으로 상호작용하도록 설계된 대화형 AI 모델인 ChatGPT를 소개했습니다. 이 형식을 통해 모델은 후속 질문에 답하고, 실수를 인정하며, 잘못된 전제를 반박하고, 부적절한 요청을 거부할 수 있습니다.
기술 방법론: RLHF 및 GPT-3.5
ChatGPT는 2022년 초에 훈련을 마친 GPT-3.5 시리즈 모델을 기반으로 파인튜닝된 버전입니다. 이 모델은 Azure AI 슈퍼컴퓨팅 인프라를 활용해 개발되었으며, 인간 피드백을 통한 강화 학습(RLHF)으로 훈련되었습니다.
훈련 과정은 여러 핵심 단계로 구성되었습니다:
- Supervised Fine-Tuning: 인간 AI 트레이너가 사용자와 AI 어시스턴트 역할을 모두 수행하는 대화를 제공했습니다. 트레이너는 모델이 작성한 제안을 활용해 응답을 구성했습니다. 이 대화 데이터셋은 대화 형식으로 변환된 InstructGPT 데이터셋과 혼합되었습니다.
- Reward Model Creation: 강화 학습을 지원하기 위해 OpenAI는 AI 트레이너가 대화 중 무작위로 선택된 메시지에 대해 여러 모델 생성 완성을 순위 매기는 비교 데이터를 수집했습니다.
- Proximal Policy Optimization (PPO): 보상 모델을 사용해 모델을 PPO 방식으로 여러 번 반복하여 추가 파인튜닝했습니다.
주요 기능 및 대화 형식
이전 모델과 달리 ChatGPT의 대화 형식은 보다 자연스럽고 반복적인 상호작용을 가능하게 합니다. 예를 들어 코딩 오류가 제시될 경우, 모델은 추가 컨텍스트를 요청하거나 사용자의 후속 설명에 기반해 잠재적인 해결책을 제안할 수 있습니다.
또한 모델은 잘못된 전제를 처리하는 능력이 향상되었습니다. InstructGPT와 비교했을 때, "크리스토퍼 콜럼버스가 2015년에 미국에 도착했다"는 질문에 InstructGPT는 사실과 다른 답변을 제공했지만, ChatGPT는 역사적 부정확성을 식별하고 전제를 반박하면서도 가상의 시나리오에 대해 대화를 이어갔습니다.
알려진 제한 사항
OpenAI는 현재 버전의 ChatGPT에 대해 몇 가지 중요한 제한 사항을 확인했습니다:
- Factuality: 모델은 때때로 "그럴듯하지만 잘못되었거나 의미 없는 답변"을 생성합니다. 이는 RL 훈련 중 진리 소스가 없고, 모델이 지나치게 신중해져 올바른 답변을 거부하거나, 감독 훈련이 인간 시연자가 아는 것에 기반해 모델을 오도할 수 있기 때문입니다.
- Sensitivity: 모델은 입력 문구에 민감하게 반응하며, 약간의 문구 변경만으로도 동일한 프롬프트에 대해 다른 답변을 제공할 수 있습니다.
- Verbosity: 트레이너가 더 길고 포괄적인 답변을 선호하는 경향과 과도한 최적화 때문에 모델은 종종 과도하게 장황하고 특정 구절을 남용합니다.
- Ambiguity: 모호한 질문에 대해 명확화 질문을 하는 대신, 모델은 일반적으로 사용자의 의도를 추측합니다.
- Safety: 부적절한 요청을 거부하려는 노력에도 불구하고, 모델은 여전히 해로운 지시나 편향된 행동에 응답할 수 있습니다. OpenAI는 Moderation API를 사용해 위험한 콘텐츠를 차단하거나 경고하지만, 오탐 및 누락이 발생합니다.
반복적 배포 및 피드백
ChatGPT는 연구 미리보기 형태로 출시되어 사용자 피드백을 수집하고 모델의 강점과 약점을 파악하고자 합니다. 이 릴리스는 GPT-3와 Codex에서 얻은 교훈을 활용해 RLHF를 통해 해롭고 사실이 아닌 출력을 줄이는 반복적 배포 전략의 일환입니다.
OpenAI는 특히 실제 환경에서 비공격적인 상황에서 발생하는 해로운 출력, 새로운 위험 및 가능한 완화 방안에 대한 문제 출력에 대한 피드백을 적극적으로 찾고 있습니다. 이를 장려하기 위해 중요한 문제를 식별한 사용자에게 API 크레딧을 제공하는 ChatGPT 피드백 콘테스트를 도입했습니다.
Sources
- OriginalIntroducing ChatGPT