OpenAI 대비 프레임워크 업데이트
OpenAI는 심각한 해를 초래할 위험을 도입할 수 있는 고급 AI 능력을 추적하고 대비하기 위한 구조화된 프로세스인 대비 프레임워크를 업데이트했습니다. 이번 업데이트는 위험 우선순위 지정을 명확히 하고, 위험 최소화 요구사항을 강화하며, 방어책의 평가 및 관리에 대한 보다 명확한 운영 지침을 제공하는 데 중점을 둡니다.
위험 우선순위 지정 및 기준
OpenAI는 능력이 심각한 해를 초래할 수 있는지 여부에 따라 능력을 분류하기 위해 구조화된 위험 평가 프로세스를 사용합니다. 능력이 다음 다섯 가지 구체적인 기준을 충족하면 사전 대비를 위해 우선순위가 지정됩니다: 타당성, 측정 가능성, 심각성, 새로운 것임, 그리고 즉시성 또는 회복 불가능성 중 하나.
능력 카테고리
프레임워크는 이중 사용 위험 및 신흥 위협을 관리하기 위해 AI 능력을 두 가지 주요 카테고리로 나눕니다:
추적 카테고리
이들은 성숙한 평가와 지속적인 방어책이 마련된 기존 영역입니다. 포함되는 분야는 다음과 같습니다:
- 생물학 및 화학 능력
- 사이버 보안 능력
- AI 자체 개선 능력
연구 카테고리
이 영역들은 잠재적으로 심각한 해를 초래할 위험이 있다고 판단되지만 아직 추적 카테고리 기준을 충족하지 못합니다. OpenAI는 현재 이러한 영역에 대한 위협 모델 및 고급 평가를 개발 중이며, 포함되는 분야는 다음과 같습니다:
- 장거리 자율성
- 샌드백킹(의도적으로 성능 저하)
- 자율 복제 및 적응
- 방어책 약화
- 핵 및 방사선
설득 위험은 모델 사양, 정치 캠페인 및 로비 활동에 대한 제한, 그리고 영향력 작전 조사 등을 통해 이 프레임워크 외부에서 관리됩니다.
능력 수준 및 운영 약속
OpenAI는 능력 수준을 두 가지 임계값으로 간소화했으며, 각각은 특정 운영 요구사항을 촉발합니다:
- 고위험 능력: 기존의 심각한 해로 이어지는 경로를 증폭시킬 수 있는 능력. 이 수준에 도달한 시스템은 배포 전에 관련 위험을 "충분히 최소화"하는 방어책을 갖추어야 합니다.
- 중대한 능력: 전례 없는 새로운 심각한 해 경로를 도입할 수 있는 능력. 이러한 시스템은 개발 및 배포 단계 모두에서 관련 위험을 충분히 최소화하는 방어책이 필요합니다.
Safety Advisory Group (SAG)은 내부 안전 리더들로 구성된 교차 기능 팀으로, 이러한 방어책을 검토하고 최종 배포 결정을 위해 OpenAI 리더십에 권고를 제공합니다. SAG의 지침은 배포 승인부터 추가 보호 또는 평가 요청까지 다양합니다.
평가 확장 및 보고
추론 진보에 의해 주도되는 경우가 많아 주요 학습 실행보다 빠른 모델 개선 주기에 발맞추기 위해, OpenAI는 테스트 규모를 확대하기 위한 자동화된 평가 세트를 구현했습니다. 이러한 평가들은 정확성을 보장하기 위해 전문가 주도의 "깊이 있는 분석"으로 보완됩니다.
보고도 두 가지 구별된 문서 유형으로 정제되었습니다:
- 능력 보고서: 모델이 위험 임계값을 초과했는지 평가합니다.
- 방어책 보고서: 방어책 설계 및 검증에 대한 상세 정보를 제공하며, "다층 방어" 원칙을 따릅니다.
최전선 환경에 대한 대응
OpenAI는 다른 최전선 AI 개발자가 비교 가능한 방어책 없이 고위험 시스템을 출시할 경우, OpenAI가 자체 요구사항을 조정할 수 있다고 명시합니다. 이러한 조정은 위험 환경이 변했음이 엄격히 확인되고, 조정에 대한 공개적인 인지가 이루어진 뒤, 해당 변경이 방어책의 보호 수준을 유지하면서 전체 심각한 해 위험을 의미 있게 증가시키지 않는다고 평가될 때만 이루어집니다.