OpenAI AI 거버넌스 약속

OpenAI는 자발적인 약속들의 세트를 통해 AI 거버넌스를 आगे 나아가도록 약속했으며, 안전, 투명성, 그리고 프론티어 AI 시스템의 책임 있는 개발에 중점을 둡니다. 이러한 약속은 레드팀링, 교차 산업 정보 공유, AI 생성 콘텐츠 식별, 그리고 모델 제한에 대한 공개 보고에 중심을 둡니다.

포괄적인 레드팀링 및 안전 평가

OpenAI는 범위 내에 있는 모든 주요 공개 모델 출시에서 내부 및 외부 레드팀링을 약속합니다. 이 과정은 독립된 분야 전문가를 끌어들여 시스템의 오용, 사회적 위험, 국가 안보 문제를 평가합니다.

레드팀링의 구체적인 초점 영역은 다음과 같습니다:

  • 생물학적, 화학적 및 방사학적 위험: 시스템이 무기 개발, 설계, 취득 또는 사용에 대한 진입 장벽을 낮출 수 있는지를 평가하는 것.
  • 사이버 능력: 시스템이 취약점 발견, 악용 또는 운영 활용에 어떻게 기여할 수 있는지 평가하며, 이러한 능력이 방어 목적에도 사용될 수 있음을 명시합니다.
  • 시스템 상호작용 및 도구 사용: 모델이 물리적 시스템을 제어할 수 있는 능력을 분석하는 것.
  • 자기 복제: 모델이 스스로의 복사본을 만들 수 있는 능력을 평가하는 것.
  • 사회적 위험: 편견과 차별을 해결하는 것.

이러한 노력을 지원하기 위해 OpenAI는 AI 안전 연구를 진전시키고 있으며, 구체적으로 의사결정 과정의 해석 가능성과 오용에 대한 시스템의 견고성에 중점을 두고 있습니다. 이러한 안전 절차는 투명성 보고서에 공개될 것입니다.

정보 공유 및 표준 설정

OpenAI는 기업 및 정부 간 신뢰와 안전 위험, 위험하거나 발생 가능한 능력, 그리고 보호 장치를 회피하려는 시도에 관한 정보 공유를 추진할 것입니다. 이는 공유 표준 및 모범 사례를 개발하고 채택하기 위한 포럼을 설립하거나 참여하는 것을 포함하며, 예를 들어 NIST AI Risk Management Framework와 같은 것이 있습니다.

이러한 메커니즘은 프론티어 능력과 발생하는 위협에 대한 정보 공유를 촉진하고, 정부, 시민 사회, 학계의 참여를 유도하여 관심 분야의 우선순위에 대한 기술 작업 그룹을 개발할 것입니다.

AI 생성 콘텐츠 식별

사용자가 인간과 AI 생성 콘텐츠를 구분할 수 있도록 보장하기 위해 OpenAI는 공개적으로 이용 가능한 시스템에서 생성된 오디오 및 시각 콘텐츠에 대한 강력한 메커니즘 개발을 약속합니다. 이는 출처 및 워터마킹 시스템의 사용을 포함합니다.

이 구현의 주요 세부 사항은 다음과 같습니다:

  • 범위: 워터마킹 시스템이 개발된 후 도입된 오디오 또는 시각 콘텐츠에 적용됩니다.
  • 도구: 해당 시스템이 콘텐츠를 생성했는지 판단하기 위한 API 또는 도구의 개발.
  • 제외 사항: 현실과 쉽게 구분할 수 있는 콘텐츠(예: 기본 AI 어시스턴트 음성)는 범위에서 제외됩니다.
  • 데이터: 워터마크 또는 출처 데이터에는 모델 또는 서비스 식별자가 포함되지만, 사용자 식별 정보는 포함되지 않습니다.

OpenAI는 또한 업계 동료 및 표준 제정 기구와 협력하여 AI 생성 콘텐츠와 사용자 생성 콘텐츠를 구분할 수 있는 기술 프레임워크를 개발할 것을 약속합니다.

투명성 및 공개 보고

OpenAI는 범위 내의 모든 새로운 중요한 모델 공개 출시 보고서를 게시하기로 약속합니다. 이러한 보고서는 다음과 상세히 설명합니다:

  • 안전 평가: 안전 평가 결과, 위험한 기능을 포함하며, 공개적으로 책임 있게 공개할 수 있는 경우에 한함.
  • 성능 제한: 적절한 사용 영역에 영향을 미치는 성능의 중대한 제한.
  • 적절한 사용: 적절하고 부적절한 사용 영역.
  • 사회적 위험: 모델이 공정성과 편향에 미치는 영향에 대한 논의.
  • 적대적 테스트: 모델의 배포 적합성을 평가하기 위한 적대적 테스트 결과.

사회적 위험 완화 및 글로벌 과제

OpenAI는 해로운 편견과 차별을 피하고 프라이버시를 보호하는 것을 포함한 사회적 위험에 대한 연구를 우선시합니다. 이는 신뢰 및 안전 팀을 강화하고 어린이를 보호하여 AI 위험을 사전에 관리하는 것을 포함합니다.

또한, OpenAI는 글로벌 과제를 해결하기 위한 프론티어 AI 시스템의 연구 및 개발을 지원하기로 합의했습니다. 예를 들어:

  • 기후 변화 완화 및 적응.
  • 조기 암 탐지 및 예방.
  • 사이버 보안: 사이버 위협 대응.

OpenAI는 또한 학생과 직원이 AI로부터 번영하도록 돕고 시민이 기술의 영향을 이해하도록 교육 및 훈련 이니셔티브를 지원할 것을 약속합니다.

Sources