OpenAI 안전 관행
OpenAI는 업계 최고의 AI 모델 개발 및 배포가 안전하고 신뢰할 수 있도록 보장하기 위해 10가지 핵심 안전 관행을 제시했습니다. 이 프레임워크는 초기 단계부터 개발 프로세스에 안전 조치를 통합하여 현재 모델을 정렬하는 단계에서부터 훨씬 더 강력한 미래 시스템을 준비하는 단계까지 이어집니다.
모델 평가 및 위험 완화
OpenAI는 출시 전 경험적 모델 레드팀 및 테스트를 수행합니다. 이 프로세스는 위험 임계값을 설정하는 Preparedness Framework에 의해 관리됩니다. 새 모델은 위험 임계값이 "Medium"을 초과하면 안전 개입이 이루어져 사후 완화 점수를 다시 "Medium"으로 되돌릴 때까지 출시되지 않습니다.
GPT-4o 출시를 위해 70명 이상의 외부 전문가가 레드팀 작업에 참여하여 초기 체크포인트의 약점을 식별했으며, 이는 이후 체크포인트 평가에 반영되었습니다.
정렬 및 안전 연구
안전 개선은 모델 지능 향상(사실 오류와 유해 출력 감소)과 실용적인 정렬, 안전 시스템, 사후 훈련 연구에 대한 목표 투자의 결합에 의해 추진됩니다. 핵심 초점 영역은 다음과 같습니다:
- Fine-tuning data: 인간이 생성한 데이터의 품질을 향상시킵니다.
- Model Specifications: 모델이 따르도록 훈련된 지침을 정제합니다.
- Robustness: 탈옥(jailbreak)과 같은 공격에 대한 시스템 회복력을 향상시키기 위한 연구를 수행하고 공개합니다.
모니터링 및 악용 방지
OpenAI는 API와 ChatGPT 전반에 걸쳐 안전 위험 및 악용을 모니터링하기 위해 다양한 도구를 활용합니다. 여기에는 전용 중재 모델 사용과 GPT-4를 활용한 콘텐츠 정책 개발 및 중재 결정 자동화가 포함되며, 이는 인간 중재자에게 노출되는 악용 자료의 양을 감소시킵니다.
산업 전반의 안전성을 높이기 위해 OpenAI는 Microsoft와 공동 공개를 통해 국가 행위자의 기술 악용에 대한 발견을 공유했습니다.
라이프사이클 및 특수 안전 초점
OpenAI는 사전 훈련부터 배포까지 전체 모델 라이프사이클에 걸쳐 안전 조치를 구현합니다. 여기에는 사전 훈련 데이터 안전, 시스템 수준 행동 조정, 견고한 모니터링 인프라에 대한 투자가 포함됩니다.
특정 고우선순위 안전 영역은 다음과 같습니다:
아동 안전
OpenAI는 아동에 대한 해를 완화하기 위해 ChatGPT와 DALL·E에 기본 가드레일을 통합했습니다. 2023년에 회사는 Thorn의 Safer와 협력하여 사용자가 이미지 도구에 해당 콘텐츠를 업로드하려 할 때 아동 성학대 자료(CSAM)를 감지하고 실종·착취 아동 국가센터에 보고했습니다.
선거 무결성
악용 방지와 투명성 확보를 위해 OpenAI는 DALL·E 3 이미지 식별 도구를 도입하고 C2PA 메타데이터를 통합하여 사용자가 미디어 출처를 식별하도록 돕습니다. 또한 ChatGPT는 미국 및 유럽의 공식 투표 정보 출처로 사용자를 안내하며, 회사는 미국 상원에서 "Deceptive AI로부터 선거 보호법"을 지원합니다.
영향 평가 및 보안
OpenAI는 화학, 생물학, 방사선 및 핵(CBRN) 위험을 포함한 AI와 관련된 위험을 측정하기 위해 영향 평가를 수행합니다. 또한 회사는 언어 모델이 다양한 직업 및 산업에 미치는 영향을 연구하고, 영향 작전에 대한 언어 모델의 함의를 분석합니다.
지적 재산 및 데이터를 보호하기 위한 보안 조치는 다음과 같습니다:
- API-based deployment: 정책 시행을 가능하게 하기 위해 API를 통한 접근을 제어합니다.
- Infrastructure security: 필요에 따라 훈련 환경 및 알고리즘 비밀에 대한 접근을 제한합니다.
- Cybersecurity programs: 내부·외부 침투 테스트, 버그 바운티 프로그램, 그리고 제3자 연구자를 위한 사이버보안 보조금 프로그램을 구현합니다.
- Future controls: GPU용 기밀 컴퓨팅 및 AI 기반 사이버 방어를 탐색합니다.
거버넌스 및 정부 파트너십
OpenAI는 전 세계 정부와 협력하여 AI 안전 정책을 알리고, 학습 내용을 공유하며 제3자 보증을 시범 운영합니다. 내부적으로 안전 의사결정은 운영 구조를 통해 관리됩니다: 교차 기능 안전 자문 그룹이 역량 보고서를 검토하고 권고안을 제시하며, 회사 리더십이 최종 결정을 내리고, 이사회가 감독합니다.
미래 진화
OpenAI는 차세대 최전선 모델을 향해 나아가면서 관행을 진화시켜야 함을 인정합니다. 여기에는 정교한 국가 행위자 공격에 대비한 보안 태세 강화와 주요 출시 전 안전 테스트에 추가 시간을 할당하는 것이 포함됩니다.
Sources
- OriginalOpenAI safety practices