OpenAI AI 시스템 행동 및 거버넌스 프레임워크

OpenAI는 ChatGPT의 행동이 어떻게 형성되는지를 명확히 하고, 보다 맞춤화 가능하고 공개적으로 의견을 반영하는 거버넌스 모델로 전환하기 위한 프레임워크를 구현하고 있습니다. 이 변화는 편향을 줄이고, 권력의 과도한 집중을 방지하며, AI 시스템이 다양한 인간 가치와 일치하도록 보장하는 것을 목표로 합니다.

AI 행동을 형성하는 두 단계 프로세스

ChatGPT의 행동은 명시적으로 프로그래밍된 것이 아니라 두 단계의 학습 과정을 통해 학습됩니다: 사전 학습(pre‑training)과 미세 조정(fine‑tuning).

사전 학습

초기 단계에서는 모델이 방대한 인터넷 텍스트 데이터셋을 사용해 학습됩니다. 모델은 문장에서 다음 단어를 예측하도록 학습함으로써 문법, 세계 지식, 추론 능력을 습득합니다. 그러나 이 단계에서는 원본 데이터에 존재하는 편향도 모델에 노출됩니다.

미세 조정

시스템 행동을 좁히기 위해 OpenAI는 인간 리뷰어가 생성한 제한된 데이터셋으로 모델을 미세 조정하는 두 번째 단계를 사용합니다. 리뷰어는 다양한 예시 입력에 대해 모델 출력에 점수를 매기는 구체적인 가이드라인을 따릅니다. 모델은 이 피드백을 일반화하여 다양한 사용자 입력에 응답합니다. 이는 OpenAI와 리뷰어 간의 주간 회의를 통해 가이드를 명확히 하고 모델 성능을 개선하는 반복적인 과정입니다.

편향 및 정책 투명성 해결

OpenAI는 훈련 과정에서 발생하는 편향을 "버그, 기능이 아님"이라고 보고, 여러 투명성 및 연구 이니셔티브를 통해 이를 감소시키겠다는 약속을 하고 있습니다:

  • 가이드라인 공개: OpenAI는 정치 및 논란이 되는 주제에 관한 가이드라인의 일부를 공유했으며, 리뷰어가 특정 정치 집단을 편들지 않도록 명시적으로 지시했습니다.
  • 리뷰어 인구통계: 회사는 리뷰어들의 집계된 인구통계 정보를 공유하여 잠재적인 편향 원천을 식별하고 완화하려고 노력하고 있습니다.
  • 기술 연구: OpenAI는 헌법 AI(Constitutional AI)와 규칙 기반 보상과 같은 외부 진보를 도입하여 보다 제어 가능한 미세 조정 프로세스를 연구하고 있습니다.
  • 지시 개선: 연구소는 논란이 되는 인물, 주제 및 잠재적 편향 함정을 다루는 데 있어 리뷰어에게 더 명확한 지시를 제공하고 있습니다.

미래 프레임워크: AI 거버넌스의 세 가지 구성 요소

AI의 혜택과 영향이 널리 퍼지도록 하기 위해 OpenAI는 세 가지 핵심 구성 요소에 기반한 전략을 개발하고 있습니다:

1. 기본 행동 개선

OpenAI는 눈에 띄는 편향과 미묘한 편향 모두를 줄여 AI 시스템을 "바로 사용할 수 있는" 상태로 만들고자 합니다. 여기에는 시스템이 "허위 정보를 만들어내는" 것을 방지하기 위한 정확도 향상과, 언제 출력을 거부하고 언제 허용해야 하는지를 올바르게 식별하도록 거부 메커니즘을 정교화하는 것이 포함됩니다.

2. 광범위한 범위 내 사용자 맞춤화

OpenAI는 사용자가 자신의 가치에 맞게 ChatGPT의 행동을 맞춤화할 수 있도록 업그레이드를 개발하고 있습니다. 악의적인 사용이나 기존 신념을 맹목적으로 증폭시키는 "아첨형 AI"의 생성을 방지하기 위해 이러한 맞춤화는 사회가 정의한 한계 내에서 이루어집니다.

3. 기본값 및 강제 한계에 대한 공공 의견 수렴

권력 집중을 방지하기 위해 OpenAI는 AI 시스템을 규정하는 규칙에 대한 공공 의견을 수집하는 파일럿 프로그램을 진행하고 있습니다. 현재 및 계획 중인 이니셔티브는 다음과 같습니다:

  • 레드 팀링: 기술 한계를 테스트하기 위해 외부 의견을 구합니다.
  • 맥락별 의견 수렴: 교육 등 특정 분야에서 AI의 역할에 대한 피드백을 요청합니다.
  • 광범위 거버넌스: 시스템 행동, 배포 정책, 워터마킹과 같은 공개 공개 메커니즘에 대한 공공 의견을 탐색합니다.
  • 제3자 감사: 외부 기관과 협력하여 안전 및 정책 노력에 대한 감사를 수행합니다.

Sources