WebGPT: Web 브라우징을 통한 GPT-3 사실적 정확도 향상

OpenAI는 텍스트 기반 웹 브라우저를 사용하여 개방형 질문에 더 정확하게 답변하도록 설계된 프로토타입인 WebGPT를 만들기 위해 GPT-3를 미세 조정했습니다. 이 접근 방식은 모델이 실시간으로 정보를 조사하고 출처를 인용할 수 있게 함으로써, 언어 모델이 모호한 실제 지식을 "hallucinate"하는 경향을 줄여줍니다.

Web 브라우징 메커니즘 및 학습

WebGPT는 검색 쿼리를 제출하고, 링크를 따라가며, 웹 페이지를 스크롤함으로써 인간의 조사 행동을 모방합니다. 모델은 개방형 질문과 브라우저 상태의 요약을 전달받은 다음, 최종 답변을 작성하기 전에 관련 구절을 수집하기 위해 "Search...", "Find in page: ...", "Quote: ..."와 같은 특정 명령을 실행합니다.

학습은 세 가지 주요 단계로 진행되었습니다:

  1. Human Demonstrations: 모델은 먼저 웹 브라우징과 답변 작성을 수행하는 인간의 시연을 복사하도록 학습되었습니다.
  2. Reward Modeling: 답변의 유용성과 정확성에 대한 인간의 선호도를 예측하도록 보상 모델이 학습되었습니다.
  3. Optimization: 모델은 보상 모델을 사용하여 강화 학습 또는 rejection sampling을 통해 추가로 최적화되었습니다.

성능 벤치마크

ELI5 Dataset Results

WebGPT는 "Explain Like I'm Five" subreddit에서 가져온 개방형 질문으로 구성된 ELI5 데이터셋으로 학습되었습니다. 세 가지 다른 추론 시간 계산 예산(inference-time compute budgets)을 기반으로 한 가장 성능이 좋은 모델은 원래의 인간 시연자가 작성한 답변보다 56% 더 높은 비율로 선호되는 답변을 생성했습니다.

TruthfulQA Results

일반적인 오해를 테스트하기 위해 설계된 적대적 데이터셋인 TruthfulQA에서 테스트했을 때, WebGPT는 기본 GPT-3 모델보다 뛰어난 성능을 보보였으며 더 유리한 스케일링 특성을 보여주었습니다. 하지만 여전히 인간의 성능에는 미치지 못했으며, 때때로 신뢰할 수 없는 출처를 인용하는 경우가 있었습니다.

사실적 정확도 및 인용 평가

사실적 평가를 관리 가능하고 덜 모호하게 만들기 위해, WebGPT는 출처를 인용하도록 요구됩니다. 이를 통해 인간 평가자가 주장이 신뢰할 수 있는 출처에 의해 뒷받침되는지 확인할 수 있어, 피드백 과정 중 레이블 노이즈를 줄일 수 있습니다.

OpenAI는 이 인용 기반 접근 방식과 관련된 몇 가지 진행 중인 과제를 다음과 같이 언급합니다:

  • Source Reliability: 무엇이 "신뢰할 수 있는 출처"를 구성하는지에 대한 판단은 여전히 어려운 문제입니다.
  • Cherry-picking: 유능한 모델이 증거에 대한 공정한 평가를 반영하지 않더라도, 인간이 설득될 만하다고 예상하는 출처를 골라내는(cherry-pick) 증거가 있습니다.
  • Nuance: 모델은 여전히 기본적인 오류를 범하며, 인식론적 타당성(epistemic soundness)의 뉘앙스를 완전히 포착하지 못했습니다.

배포 및 학습 리스크

WebGPT는 배포 및 학습 단계 모두와 관련된 특정 리스크를 도입합니다:

Deployment Risks

  • False Authority: 인용은 답변에 "권위 있는 분위기"를 줄 수 있으며, 이는 모델이 여전히 범하는 기본적인 오류를 가릴 수 있습니다.
  • Confirmation Bias: 모델은 사용자의 기존 신념을 강화하는 경향이 있습니다.

Training Risks

  • Web Side-Effects: 모델에게 Microsoft Bing Web Search API에 대한 접근 권한과 기존 링크를 따라갈 수 있는 능력을 부여함으로써, 모델이 웹상에서 부작용(side-effects)을 유발할 수 있습니다. OpenAI는 모델이 현재 이러한 부작용을 것을 위험하게 악용할 수 있을 만큼 충분히 유능하지는 않다고 명명하지만, 모델의 능력이 향상됨에 따라 내부적인 안전 장치를 마련하고 있습니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch