OpenAI 외부 테스트 프레임워크: 프론티어 AI 안전
OpenAI는 독립적인 제3자 평가를 활용하여 프론티어 AI 모델의 능력과 위험에 대한 안전 주장 검증, 사각지대 식별, 투명성 증대를 수행합니다. 이러한 외부 평가는 자체 확인을 방지하고 책임 있는 배포 결정을 알리는 독립적인 엄격성의 층을 제공합니다.
외부 평가의 세 가지 주요 형태
OpenAI는 외부 파트너와 세 가지 구별된 협력 모델을 활용하여 모델을 평가합니다:
1. 독립적 평가
독립 연구소는 자체 방법론을 사용해 개방형 테스트를 수행하여 특정 프론티어 능력에 대한 주장 또는 평가를 생성합니다.
- Application in GPT-5: OpenAI는 GPT-5에 대한 장기적 자율성, 음모, 기만, 감독 회피, 공격적 사이버 보안, 그리고 습식 실험실 계획 타당성에 초점을 맞춘 외부 평가를 조율했습니다.
- Access Levels: 이러한 테스트를 용이하게 하기 위해 OpenAI는 초기 모델 체크포인트에 대한 보안 액세스, 제로 데이터 보존 옵션, 그리고 완화 기능이 적은 모델(예: 'helpful-only' 모델)에 대한 액세스를 제공합니다.
- Reasoning Transparency: 일부 조직은 사고 과정을 추적하기 위한 직접적인 사슬-사고 접근 권한을 받았으며,これにより 평가자는 최종 출력에서는 보이지 않는 샌드백킹이나 음모 같은 행동을 식별할 수 있었습니다.
2. 방법론 검토
방법론 검토는 주요 AI 연구소 외부에서 흔히 이용할 수 없는 평가 반복에 필요한 인프라 또는 기술 전문성이 부족할 때 사용됩니다. 이러한 경우 외부 평가자는 연구소의 내부 프레임워크와 증거를 검토하여 권장 사항을 제시합니다.
- Application in gpt-oss: gpt-oss 오픈-웨이트 모델에 대해 OpenAI는 바이오 및 사이버 도메인에서 최악의 경우 위험을 추정하기 위해 적대적 미세 조정을 사용했습니다. 외부 평가자는 내부 방법과 결과를 검토하여 최종 적대적 미세 조정 프로세스의 변경을 이끌어낸 피드백을 제공했습니다.
- Outcome: 이러한 검토 결과, 채택된 권장 사항과 채택되지 않은 권장 사항의 근거를 포함하여 해당 모델의 시스템 카드 및 관련 연구 논문에 문서화됩니다.
3. 주제별 전문가(SME) 탐사
SME 탐사는 전문가들이 설문을 통해 구조화된 입력을 제공하기 위해 실제 세계 작업에서 모델을 직접 평가하는 것을 포함합니다. 이는 특정 보호 장치에 대한 스트레스 테스트보다는 능력 평가에 초점을 맞춘다는 점에서 레드 팀링과 다릅니다.
- Application in ChatGPT Agent and GPT-5: 전문가들은 helpful-only 모델을 사용하여 종단간 생물학적 시나리오를 테스트했습니다. 그들은 모델의 '초보자 향상'—동기 부여된 초보자를 전문가自身의 능력과 비교하여 숙련된 실행에 더 가까이 이동시킬 수 있는 모델의 정도—를 점수화했습니다.
- Integration: 이 전문가 판단은 정적 평가에서 놓칠 수 있는 실제 세계 맥락으로 Preparedness Framework 평가를 보완하는 데 사용됩니다.
제3자 협력의 원칙
OpenAI는 투명성과 보안의 균형을 맞추기 위해 세 가지 핵심 원칙에 따라 외부 파트너십을 구성합니다:
- Confidentiality and Publication: 평가자는 비공개 정보에 접근하기 위해 비공개 계약(NDA)에 서명합니다. OpenAI는 공개 전에 기밀성과 사실 정확성을 검토합니다. 공개된 외부 작업의 예로는 METR의 GPT-5 보고서와 Apollo Research의 OpenAI o1 보고서가 있습니다.
- Secure Access: 안전 완화가 없는 모델과 같은 민감한 모델에 대한 접근은 중요한 안전 질문에 필요한 경우에만 부여되며, 엄격하고 진화하는 보안 통제를 따릅니다.
- Financial Sustainability: OpenAI는 생태계의 지속 가능성을 보장하기 위해 직접 지불 또는 API 크레딧을 통해 모든 제3자 평가자에게 보상을 제공합니다. 보상은 평가 결과에 절대 의존하지 않습니다.
더 넓은 안전 생태계
외부 테스트는 더 큰 안전 전략의 한 구성 요소입니다. OpenAI는 또한 미국 CAISI와 영국 AISI와 협력하고, 집단적 정렬 프로젝트에 참여하며, 정신 건강과 사용자 복지를 위한 작업 안내를 위해 Global Physician Network와 Well-Being 및 AI 전문가 위원회와 같은 자문 단체를 활용합니다.