OpenAI AI 정책 제안 및 안전 프레임워크

OpenAI는 AI 역량의 급격한 발전으로 인해 자발적 약속에서 민주적 감독으로의 전환이 필요하다고 주장하며, 미국 내에서 역량 기반의 의무적인 국가 AI 안전 규제를 추진하기 위한 전략적 행보를 발표했습니다. 회사는 AI 역량이 이를 관리하는 기관의 능력을 앞지르기 전에 지속 가능한 안전장치를 구축할 수 있는 "정책적 창(policy window)"이 현재 열려 있다고 주장합니다.

의무적 국가 AI 안전 요구사항

OpenAI는 미국 의회가 역량 기반이며 진화 가능한 의무적 국가 AI 안전 규제를 시행할 것을 권고하고 있습니다. 제안된 프레임워크는 다음과 같은 핵심 영역에 집중합니다:

  • 대상 애플리케이션: 안전 요구사항은 스타트업이나 소규모 연구자가 아닌, 가장 유능한 프론티어 시스템을 개발하는 소수의 자원이 풍부한 연구소에 구체적으로 적용되어야 합니다.
  • 연방 프레임워크 구성 요소: OpenAI의 "Blueprint for Democratic Governance of Frontier AI"를 기반으로, 회사는 공통 테스트, 독립적 평가 요구사항, 더 강력한 사이버 보안 보호, 명확한 사고 보고 규칙, 그리고 재귀적 자기 개선(recursive self-improvement)을 향한 진척도를 추적하기 위한 공유 조치를 모색하고 있습니다.
  • 개방형 및 폐쇄형 모델의 균형: OpenAI는 미국의 리더십을 위해 개방형과 폐쇄형 모델이 모두 필요하며, 연방 프레임워크가 경쟁을 저해하거나 혁신을 해외로 몰아내지 않으면서 프론티어 리스크를 다루어야 한다고 주장합니다.
  • 거버넌스 전환: 목표는 연구소들이 자체 규칙을 설정하는 파편화된 민간 거버넌스 시스템을 민주적으로 책임 있는 표준과 독립적 검증으로 대체하는 것입니다.

캘리포니아 주 법안 지원

연방 차원의 조치를 기다리는 동안, OpenAI는 주 단위의 법안이 의회가 결국 성문화할 국가적 기준을 만드는 "역거버넌스(reverse federalism)" 전략을 지원합니다. OpenAI는 다음 네 가지 캘리포니아 법안을 공식적으로 지지합니다:

  • SB 813: AI 리스크를 평가하기 위해 자격을 갖춘 독립적인 조직을 지정하는 프로세스를 구축합니다.
  • AB 1405: AI 감사인에 대한 등록, 독립성, 투명성 및 책임 요구사항을 생성합니다.
  • SB 1119: 청소년 안전에 집중하며, 컴패니언 챗봇에 대한 연령 확인, 리스크 평가, 독립적 감사 및 부모 통제 기능을 요구합니다.
  • AB 1864: 유전자 합성 제공업체 및 벤치탑 합성 장비 제조업체가 AI 기반 생물학적 위협을 방지하기 위해 연방 스크리닝 표준을 준수하도록 요구합니다.

재귀적 자기 개선 및 연구 가속화

OpenAI는 AI가 독립적으로 더 유능한 AI의 연속적인 세대를 구동하는 완전 자율적 재귀적 자기 개선은 현재 일어나고 있지 않다고 밝히고 있습니다. 그러나 회사는 AI가 차세대 모델을 개발하고 정렬(alignment)하는 데 사용되는 연구의 일부를 이미 가속화하고 있다고 언급합니다.

이를 관리하기 위해, OpenAI는 단순한 역량 성장보다 안전과 정렬을 우선시하도록 인간의 감독 하에 자동화된 AI 연구원을 구축하는 것을 목표로 합니다. 회사는 정부가 개발 속도를 늦추거나 중단해야 할 시점을 결정하는 공유된 안전 기준을 설정하여, 두 요소가 충돌할 경우 역량 성장보다 안전을 우선시하도록 권고합니다.

산업 표준 및 모니터링

OpenAI는 의무적인 연방 안전장치를 보완하기 위해 산업 주도 표준을 촉구하고 있으며, 특히 인간의 의도를 위반하는 방식으로 모델이 목표를 추구하는 "미정렬(misalignment)" 모니터링에 초점을 맞추고 있습니다.

주요 모니터링 및 공개 제안사항은 다음과 같습니다:

  • 보안 침해 통지: 모델이 보호된 시스템에 접근하거나 변경하기 위해 보안 제어를 우회하는 경우, 기업은 즉시 서면 통지를 제공해야 합니다.
  • 사고 보고: OpenAI는 심각한 AI 사고에 대한 연방 보고 요구사항을 것을 지지하며, 중대한 미정렬 사고에 대한 보고를 위한 자체 프레임워크를 개발 중입니다.
  • 국제적 협력: OpenAI는 AI 연구 및 실패가 전 세계적인 결과를 초래할 수 있기 때문에 역량을 측정하고 리스크를 관리하기 위한 호환 가능한 국제 표준이 필요하다고 주장합니다.

내부 안전 조치

OpenAI는 모델 개발 수명 주기 전반에 걸쳐 다음과 같은 여러 내부 안전장치를 구현했습니다:

  • 격리(Isolation): 프론티어 연구 워크로드에 대한 더 강력한 격리.
  • 행동 모니터링: 도구 사용이 가능한 학습 및 평가 과정 중 모델 행동에 대한 모니터링 확대.
  • Astra-Specific Safeguards: Astra 모델의 경우, OpenAI는 전체 궤적(사고의 연쇄 포함)에 대한 보편적 모니터링과 내부 배포 전 의무적인 정렬 평가 게이트를 도입했습니다.

Sources