OpenAI 프론티어 리스크 및 준비 프레임워크

OpenAI는 전문 Preparedness 팀과 Risk-Informed Development Policy(RDP)를 생성하여 구조화된 katastrofic 위험 준비 접근 방식을 구현하고 있습니다. 이 이니셔티브는 현재 고급 모델의 능력을 초과하는 시스템인 프론티어 AI 모델이 초래하는 심각한 위험을 사전에 식별하고 완화하여 인공 일반 지능(AGI)의 안전한 개발을 보장하는 것을 목표로 합니다.

준비 팀 및 위험 범주

Aleksander Madry가 이끄는 Preparedness 팀은 능력 평가, 평가, 내부 레드 팀링을 통합하여 katastrofic 위험을 추적하고 예측합니다. 팀은 네 가지 주요 위험 범주에 중점을 둡니다:

  • 화학, 생물, 방사능, 핵 (CBRN) 위협: 위험한 물질의 생성 또는 배포와 관련된 위험.
  • 사이버 보안: AI가 사이버 공격의 규모나 정교함을 향상시킬 수 있는 잠재력.
  • 자율 복제 및 적응 (ARA): 스스로 복제하거나 독립적으로 진화할 수 있는 AI 시스템과 관련된 위험.
  • 개인화된 설득: AI를 사용하여 대규모로 개인을 조작하거나 설득하는 것.

위험 정보 기반 개발 정책 (RDP)

개발 프로세스를 관리하기 위해 OpenAI는 위험 정보 기반 개발 정책(RDP)을 유지하고 있습니다. 이 정책은 다음을 위한 공식적인 프레임워크를 수립합니다:

  1. 평가 및 모니터링: 프론티어 모델의 능력을 평가하기 위한 엄격한 방법 개발.
  2. 보호 조치: 식별된 위험 수준에 기반한 대응 및 보호 조치의 스펙트럼 생성.
  3. 거버넌스: 개발 수명 주기 전반에 걸쳐 책임감과 감독을 위한 구조 수립.

RDP는 모델 배포 전후에 수행되는 기존 위험 완화 및 정렬 작업을 보완하도록 설계되었습니다.

AI 준비 도전과 "예상치 못한 위험"

"예상치 못한 위험" 작업 스트림의 일환으로, OpenAI는 비명백한 위험 영역을 드러내기 위해 Preparedness Challenge를 실시했습니다. 이 도전은 plausible하지만 독특한 위험 시나리오를 식별한 상위 10개의 제출작에 API 크레딧으로 $25,000을 수여했습니다.

도전의 주요 결과

제출작 분석에 따르면, 약 70%의 참가자들이 온라인 급진화, 극화, 정치적 영향 등을 포함한 악의적 설득 능력의 향상을 주요 위협으로 식별했습니다. 기타 식별된 위험에는 다음과 같은 것이 포함됩니다:

  • 재정 안정: 전략적으로 중요한 국가에서 금융 위기를 초래함.
  • 정보 보안: 기밀 정보의 역공학 가능성 증가 또는 공공 환경에서 개인 정보 식별 가능성 증가.
  • 공공 안전: 라디오 주파수를 통해 비행 경로 방해 또는 의료 용량 간섭.
  • 사이버 범죄: 몸값을 위해 컴퓨터를 손상시키는 사이버 공격의 규모 확대.
  • 사회 공학: 협박 및 사기의 대상 식별.

OpenAI는 이러한 제출작이 기술적 엄격성, 독창성, 잠재적 피해 규모, 그리고 명확성을 기준으로 평가되었다고 언급했으며, 특히 AI 도구가 비-AI 방법보다 명확한 우위를 제공하는 사례를 강조했습니다.

Sources