OpenAI 레드팀 네트워크

OpenAI는 다양한 외부 도메인 전문 지식을 AI 모델의 안전 평가에 통합하기 위해 레드팀 네트워크를 설립했습니다. 이 이니셔티브는 OpenAI를 일회성 외부 참여에서 신뢰할 수 있는 전문가로 구성된 지속적인 공식 커뮤니티로 이동시켜, 모델 및 제품 개발 수명 주기의 다양한 단계에서 위험 평가 및 완화에 정보를 제공합니다.

AI 위험 평가 공식화

OpenAI 레드팀 네트워크는 주요 출시 이전에 수행되는 일련의 고립된 테스트가 아니라 주제별 전문가의 영구적인 자원으로 설계되었습니다. 이 구조는 안전 프로세스에 더 반복적이고 지속적인 입력을 가능하게 합니다.

네트워크의 주요 특징은 다음과 같습니다:

  • Iterative Deployment: 레드팀은 반복적 배포 과정의 핵심 부분으로 간주되며, GPT-4와 DALL·E 2와 같은 모델에 대한 외부 전문가와의 이전 작업을 기반으로 합니다.
  • Flexible Engagement: 멤버들은 특정 프로젝트에 대한 그들의 특정 전문 지식에 따라 호출됩니다. 시간 commitment는 유연하며, 연간 최소 5~10시간 정도일 수 있습니다.
  • Collaborative Environment: 특정 위탁 캠페인을 넘어, 멤버들은 서로 소통하여 결과를 공유하고 일반적인 레드팀 관행을 나눌 수 있습니다.
  • Complementary Approach: 네트워크는 제3자 감사, Researcher Access Program, 오픈소스 평가와 같은 다른 안전 조치와 함께 기능합니다.

대상 도메인 전문성

OpenAI는 AI 시스템이 다양한 관점과 실제 경험에서 평가될 수 있도록 지리적 및 도메인 다양성을 우선시하고 있습니다. 네트워크는 다음과 같은 광범위한 분야의 전문가를 찾고 있습니다, 이에 한정되지 않으며:

  • Science and Technology: 생물학, 화학, 물리학, 컴퓨터 과학, 사이버 보안, 그리고 생체 인식.
  • Social Sciences: 정치학, 경제학, 사회학, 심리학, 인류학, 그리고 인지 과학.
  • Law and Policy: 법, 의료, 금융, 그리고 정치적 이용.
  • Ethics and Safety: 공정성과 편향, 정렬, 아동 안전, 개인 정보 보호, 그리고 허위/오류 정보.
  • Communication: 언어, 언어학, 설득, 그리고 스테가노그래피.

멤버십에 AI 시스템과의 사전 경험은 필요하지 않습니다. 주된 가치는 전문가가 AI 영향 평가에 가져오는 도메인별 관점이기 때문입니다.

보상 및 기밀 유지

레드팀 네트워크 참여는 보상되는 활동입니다. 그러나 레드팀은 종종 사전 출시 또는 민감한 기능을 테스트하기 때문에 참여자는 일반적으로 비공개 계약(NDA)의 대상이 됩니다. 멤버십 자체는 멤버가 자신의 독립 연구를 출판하는 능력을 제한하지 않지만, 특정 프로젝트 참여는 무기한 동안 기밀로 유지됩니다.

대체 안전 기여 경로

레드팀 네트워크에 속하지 않은 사람들을 위해, OpenAI는 AI 안전에 기여할 수 있는 다른 경로를 제공합니다:

오픈소스 평가(Evals)

OpenAI의 오픈소스 Evals 저장소는 커뮤니티가 안전 평가를 수행할 수 있는 템플릿을 제공합니다. 기존 평가의 예시는 다음과 같습니다:

  • Persuasion: AI가 다른 AI를 속여 비밀 단어를 말하게 하거나(MakeMeSay) 기금을 기부하도록 설득할 수 있는지 테스트합니다(MakeMePay).
  • Steganography: AI가 탐지되지 않게 비밀 메시지를 전달하거나 직접적인 소통 없이 조정할 수 있는지 테스트합니다(Schelling Point).

Researcher Access Program

이 프로그램은 책임 있는 AI 배포와 관련된 위험 완화를 연구하는 연구자를 지원하기 위해 크레딧을 제공합니다.}

Sources