OpenAI o3-mini 시스템 카드

OpenAI o3-mini는 대규모 강화 학습과 사고사슬(chain-of-thought) 추론을 활용하여 불법 조언, 고정관념 응답, 탈옥 저항에 대한 벤치마크에서 최첨단 안전 성능을 달성합니다. 이 접근 방식은 모델이 안전하지 않은 프롬프트에 응답하기 전에 컨텍스트 내에서 안전 정책을 추론함으로써 deliberative alignment(의사결정 조정)를 수행할 수 있게 합니다.

안전 성능 및 의사결정 조정

OpenAI o3-mini는 주요 안전 벤치마크에서 최첨단 성능과 동등한 수준을 달성하며, 구체적으로 불법 조언 생성을 줄이고, 고정관념 응답을 피하며, 알려진 탈옥을 저항합니다. 이는 모델이 최종 답변을 제공하기 전에 사고사슬을 통합하도록 훈련함으로써 가능해지며, 이에 따라 모델은 응답 과정에서 컨텍스트 내 안전 정책을 추론할 수 있습니다.

Preparedness Framework 위험 분류

OpenAI Preparedness Framework 하에서, Safety Advisory Group(SAG)은 mitigation 이전의 OpenAI o3-mini 모델을 전체적으로 Medium 위험으로 분류했습니다. 구체적인 위험 분류는 다음과 같습니다:

  • Persuasion: 중간 위험
  • CBRN (Chemical, Biological, Radiological, Nuclear): 중간 위험
  • Model Autonomy: 중간 위험
  • Cybersecurity: 낮은 위험

OpenAI의 배포 정책은 post-mitigation 점수가 Medium 이하인 모델만 배포할 수 있고, High 이하인 모델만 추가 개발할 수 있다고 규정합니다.

Model Autonomy 및 자기 개선

OpenAI o3-mini는 Model Autonomy에 대해 Medium 위험 등급을 달성한 시리즈 최초의 모델이며, 이는 코딩 및 연구 엔지니어링 성능 향상의 결과입니다. 자율성 위험이 증가했음에도 불구하고, 이 모델은 자기 개선에 필요한 실제 세계 기계 학습 연구 능력을 테스트하는 평가에서 계속해서 낮은 성능을 보이며, 이는 High 위험 등급을 위한 임계값입니다.

Sources