OpenAI Superalignment 신속 보조금

OpenAI는 슈퍼휴먼 AI 시스템의 안전성과 정렬을 보장하기 위한 기술 연구를 지원하기 위해 1,000만 달러 규모의 보조금 프로그램을 출시했습니다. 이 이니셔티브는 인간의 지능을 훨씬 초과하는 능력을 갖춘 AI 시스템을 조종하고 신뢰할 수 있는 방법을 찾는 critical한 과제를 해결합니다.

슈퍼휴먼 AI 정렬의 도전

슈퍼휴먼 AI 시스템을 정렬하는 것은 현재 AI 정렬과根本적으로 다른 기술적 도전을 제시합니다. 현재 시스템은 일반적으로 인간 피드백을 통한 강화 학습(RLHF)을 사용하여 정렬되지만, 이 방법은 인간 감독에 의존하며, AI 능력이 인간 이해를 초과할 때 부족해집니다.

슈퍼휴먼 AI 시스템은 인간이 완전히 평가할 수 없는 복잡하고 창의적인 행동을 보일 수 있습니다. 예를 들어, OpenAI는 슈퍼휴먼 모델이 altamente 복잡한 코드 백만 줄을 생성하면, 인간 검토자는 그 코드가 안전하게 실행될 수 있는지 위험한지 신뢰할 수 없게 된다고 지적합니다. 따라서 중심적인 기술적 문제는 인간이 znacz하게 더 똑똑한 시스템에 대한 통제와 신뢰를 유지할 수 있는 방법을 결정하는 것입니다.

Superalignment Fast Grants 프로그램 세부사항

Eric Schmidt와의 파트너십 하에, OpenAI는 학술 실험실, 비영리 단체, 개인 연구자에게 1,000만 달러의 지원을 제공합니다. 이 프로그램은 경험이 풍부한 정렬 연구자와 분야의 신규 진입자 모두를 유치하도록 설계되었습니다.

자금 등급 및 자격

  • General Grants: 개인 연구자, 비영리 단체, 학술 실험실을 위한 100,000달러에서 2백만 달러 범위의 보조금을 제공합니다.
  • OpenAI Superalignment Fellowship: 대학원생을 위한 1년짜리 펠로우십으로, 75,000달러의 stipend와 75,000달러의 컴퓨팅 및 연구 자금을 제공합니다(총 150,000달러).
  • Experience Requirements: AI 정렬 사전 경험은 지원에 필수가 아닙니다.

우선 연구 방향

OpenAI는 정렬과 안전성에서 돌파구를 찾고 있는 몇 가지 핵심 기술 영역을 확인했습니다:

약한 것에서 강한 것으로의 일반화

이 연구는 강력한 모델이 '약한' 감독자(인간)의 감독으로부터 어떻게 일반화할 수 있는지에 초점을 맞춥니다. 목표는 덜 capaz한 엔티티로부터 피드백을 받는 슈퍼휴먼 모델이 어떻게 학습하는지를 이해하고 통제하는 것입니다.

해석 가능성

해석 가능성 연구는 AI 모델의 내부 메커니즘을 이해하는 것을 목표로 합니다. 이 연구의 주요 응용은 모델의 정직성을 검증하기 위한 'AI 거짓말 탐지기'와 같은 도구의 개발입니다.

확장 가능한 감독

확장 가능한 감독은 인간이 개별적으로 처리할 수 있는 능력을 초과하는 복잡한 작업을 수행할 때 다른 AI 시스템의 출력을 평가하는 데 인간 운영자를 돕기 위해 AI 시스템을 사용하는 것을 포함합니다.

추가 연구 분야

OpenAI는 또한 다음과 관련된 연구 자금 지원에 관심이 있습니다:

  • 정직성
  • 사고사슬 충실도
  • 적대적 강건성
  • 평가 및 테스트베드

Sources