OpenAI의 AI 안전 접근 방식

OpenAI는 강력한 AI 시스템이 안전하고 광범위하게 유익하도록 다층 안전 프레임워크를 활용합니다. 이 접근 방식은 엄격한 사전 배포 테스트, 반복적인 실제 배포, 지속적인 정렬 연구를 결합하여 위험을 완화하고 모델 행동을 개선합니다.

사전 배포 테스트 및 정렬

OpenAI는 새로운 시스템을 출시하기 전에 엄격한 테스트를 수행하고 외부 전문가의 피드백을 받습니다. 조직은 인간 피드백을 활용한 강화 학습(RLHF)과 같은 기술을 사용하여 모델 행동과 정렬을 개선합니다.

GPT-4의 경우, OpenAI는 공개 출시 전에 모델을 보다 안전하고 정렬되도록 만들기 위해 조직 전체에서 6개월 이상을 투자했습니다.

반복적 배포 및 실제 학습

OpenAI는 실험실 기반 테스트에는 한계가 있으며 기술의 모든 유익하거나 악용되는 사용을 예측할 수 없다고 믿습니다. 이를 해결하기 위해 반복적인 배포 전략을 사용합니다:

  • 점진적 출시: 새로운 AI 시스템은 충분한 안전 장치를 갖춘 점점 확대되는 사용자 그룹에게 신중하게 출시됩니다.
  • 오용 모니터링: 모델을 서비스와 API를 통해 제공함으로써 OpenAI는 오용을 감시하고 조치를 취할 수 있으며, 이론이 아닌 실제 데이터에 기반한 완화책을 구축합니다.
  • 사회적 조정: 반복적인 배포는 사회와 이해관계자들이 AI 개발에 대해 중요한 의견을 제시할 수 있게 하며, 기술이 보다 효과적으로 채택될 시간을 제공합니다.

아동 안전 및 콘텐츠 관리

아동 보호는 OpenAI 안전 노력의 핵심 초점입니다. 조직은 증오, 괴롭힘, 폭력 또는 성인 콘텐츠 생성을 금지하는 엄격한 사용 정책을 유지합니다.

GPT-4의 주요 안전 지표는 다음과 같습니다:

  • 금지된 콘텐츠: GPT-4는 GPT-3.5에 비해 금지된 콘텐츠 요청에 응답할 확률이 82% 낮습니다.
  • 아동 안전 도구: OpenAI는 Thorn의 Safer를 사용하여 이미지 도구에 업로드된 아동 성학대 자료(CSAM)를 감지, 검토 및 보고하여 실종·착취 아동 국립센터에 전달합니다.
  • 연령 요건: 사용자는 18세 이상이거나, 13세 이상이며 부모의 승인을 받아야 합니다.

OpenAI는 또한 Khan Academy와 같은 파트너와 협력하여 학생 및 교사를 위한 AI 기반 어시스턴트와 같은 특정 사용 사례에 맞춘 안전 완화책을 개발합니다.

개인정보 보호 및 데이터 처리

OpenAI의 대규모 언어 모델은 공개적으로 이용 가능한 콘텐츠, 라이선스가 있는 콘텐츠, 그리고 인간 검토자가 생성한 라이선스 콘텐츠를 포함한 방대한 말뭉치를 기반으로 학습됩니다. 데이터는 모델을 보다 유용하게 만들기 위해 사용되며, 서비스 판매, 광고 또는 사람들의 프로필을 구축하는 데 사용되지 않습니다.

개인 정보를 보호하기 위해 OpenAI는 여러 전략을 사용합니다:

  • 개인정보 제거: 가능한 경우 훈련 데이터셋에서 개인 정보를 제거합니다.
  • 거부 응답: 모델은 개인의 개인정보 요청을 거부하도록 미세 조정됩니다.
  • 삭제 요청: 조직은 개인이 자신의 개인정보 삭제를 요청하면 이에 대응합니다.

사실 정확성 및 환각

OpenAI는 대규모 언어 모델이 패턴에 기반해 다음 단어 시퀀스를 예측하기 때문에 사실 부정확성이 발생할 수 있음을 인식합니다. 정확성을 향상시키기 위해 OpenAI는 잘못된 ChatGPT 출력에 대한 사용자 피드백을 주요 데이터 소스로 활용합니다.

이 반복적인 개선 과정을 통해 GPT-4는 GPT-3.5에 비해 사실 기반 콘텐츠를 생성할 확률이 40% 높습니다.

글로벌 거버넌스 및 지속적 연구

OpenAI는 AI 개발이 효과적으로 관리되고 기업이 앞서 나가기 위해 "절차를 생략"하는 것을 방지하기 위해 글로벌 거버넌스가 필요하다고 믿습니다. OpenAI는 정부와 적극적으로 협력하여 엄격한 안전 평가가 규제로 채택되도록 합니다.

조직은 AI 안전과 능력 향상이 동시에 이루어져야 한다고 주장합니다. 더 능력 있는 모델은 지시를 더 잘 따르고 조정하기 쉽기 때문입니다. OpenAI는 AI 시스템이 진화함에 따라 안전 조치를 지속적으로 강화할 것이며, 향후 모델에 대한 추가 안전 작업이 6개월 이상 걸릴 수도 있습니다.

Sources