사람과 AI를 통한 레드 팀링 발전 – OpenAI의 접근 방식 및 o1 패밀리 적용
TL;DR
OpenAI는 AI 모델에 대한 외부 레드 팀링의 4단계 방법을 설명하는 백서를 출판하고, 이 방법이 공개 출시 전에 OpenAI o1 패밀리를 테스트하는 데 어떻게 사용되었는지 설명했습니다.
외부 레드 팀링 접근 방식
이 백서는 효과적인 레드 팀링 캠페인을 설계하기 위한 반복 가능한 프로세스를 설명합니다.
1. 레드 팀링 그룹 구성 선택
레드 팀 구성은 모델의 목표 및 핵심 테스트 영역을 기반으로 합니다. 팀은 자연 과학, 사이버 보안, 지역 정치 지식, 또는 사용되는 언어 전문 지식과 같은 다양한 관점을 가진 사람들로 구성됩니다. 위협 모델링은 예상되는 모델 기능, 이전에 관찰된 문제, 잠재적 응용을 고려하여 테스트 영역의 우선순위를 정하기 위해 연습 이전에 수행됩니다. 내부 팀은 초기 우선순위를 설정하며, 외부 레드 팀러는 이를 나중에 다듬거나 확장합니다.
2. 레드 팀러가 접근할 모델 또는 시스템 버전 결정
레드 팀러에게 제공되는 모델 버전은 결과에 영향을 미칠 수 있으며 캠페인 목표와 일치해야 합니다. 안전 완화 조치 없이 수행되는 초기 액세스 테스트는 향상된 기능에서 비롯된 새로운 위험을 드러낼 수 있으며, 이후 버전은 계획된 완화 조치를 테스트할 수 있습니다. 레드 팀러는 캠페인 전반에 걸쳐 여러 버전을 테스트할 수 있습니다.
3. 인터페이스, 지침, 문서 가이드라인 생성
효과적인 상호작용은 명확한 지침, 적절한 테스트 인터페이스, 그리고 실행 가능한 문서에 의존합니다. 지침은 모델 설명, 기존 또는 계획된 보호 조치, 인터페이스 사용 방법, 우선 테스트 영역, 결과 문서화 지침을 포함합니다. 인터페이스는 API 또는 ChatGPT와 같은 소비자 제품 인터페이스가 될 수 있으며, 이를 통해 신속한 프로그래밍 테스트, 특정 프롬프트에 대한 피드백 수집, 또는 사용자 상호작용 시뮬레이션이 가능합니다. 이러한 인터페이스로부터 얻은 구조화된 피드백은 나중에 위험 평가 및 자동화된 평가에 정보를 제공할 수 있습니다.
4. 데이터 종합 및 평가 생성
캠페인 이후, 레드 팀 출력물은 품질을 평가하고 기존 정책에 매핑하여 정책 위반 여부, 새로운 정책 필요 여부, 또는 행동 변경 필요 여부를 결정합니다. 품질 검사를 통과한 데이터는 향후 모델 업데이트를 위한 반복 가능한 자동화된 평가로 변환될 수 있습니다.
OpenAI o1 패밀리 적용
OpenAI는 이 접근 방식을 적용하여 공개 사용을 위한 OpenAI o1 패밀리 모델을 준비했습니다. 외부 레드 팀링 캠페인은 모델을 다음과 같은 측면에서 테스트했습니다:
- 탈옥에 대한 저항
- 실제 세계 공격 계획 프롬프트의 안전한 처리
- 자연 과학에서의 안전한 적용
- AI 연구 및 개발 역량과 같은 보다 광범위한 주제
이 캠페인은 위에서 설명한 네 단계를 따르며, 적절한 팀 구성, 모델 버전, 인터페이스, 문서를 사용하여 정책 검토 및 자동화 평가 파이프라인에 공급되는 데이터를 생성했습니다.
Note: 모든 세부 사항은 백서 및 동반 발표에서 직접 인용되었으며, 외부 주장, 숫자, 또는 인용문은 추가되지 않았습니다.