OpenAI 사이버 탄력성 전략
OpenAI는 advancing AI 사이버 보안 능력의 이중 사용 위험을 관리하기 위한 포괄적인 전략을 발표했습니다. 회사는 계층형 안전 스택을 배포하고 새로운 방어 도구 및 자문 기구를 설립하여 모델이 더욱 강력해질수록 사이버 보안 수비자에게 악의적인 행위자보다 상당한 이점을 제공하도록 보장합니다.
AI 사이버 능력의 급속한 발전
AI 모델은 사이버 보안 작업을 수행하는 능력에서 상당한 향상을 보이고 있습니다. OpenAI는 캡처더플래그(CTF) 도전 과제를 통해 측정된 능력이 2025년 8월 GPT-5에서 27%에서 2025년 11월 GPT-5.1-Codex-Max로 76% 향상되었다고 보고합니다.
OpenAI는 이제 Preparedness Framework에 따라 사이버 보안 능력에서 "High" 수준에 도달하는 모델을 대비하고 있습니다. 이 수준은 잘 방어된 시스템에 대해 작동하는 제로데이 원격 익스플로잇을 개발하거나 복잡하고 은밀한 기업 또는 산업 침입 작업에 의미 있는 지원을 제공할 수 있는 모델로 정의됩니다.
오용 완화를 위한 계층형 안전 스택
방어적 및 공격적 사이버 워크플로가 종종 동일한 기반 지식을 의존하기 때문에, OpenAI는 수비자의 유용성을 유지하면서 악의적인 향상을 제한하기 위해 방어-in-depth 접근법을 채택하고 있습니다.
인프라 및 모니터링
기초적으로, OpenAI는 다음과 같은 조합을 활용합니다:
- 접근 제어
- 인프라 강화
- 이그레스 제어
- 잠재적인 악성 활동을 탐지하기 위한 시스템 전반 모니터링
안전하지 않은 활동이 감지되면, 시스템은 출력을 차단하거나, 프롬프트를 덜 능력 있는 모델로 라우팅하거나, 심각도와 반복 행동에 따라 인간 검토로 문제를 escalate할 수 있습니다.
모델 훈련 및 레드 팀링
OpenAI는 프론티어 모델을 훈련하여 명확한 사이버 악용을 가능하게 하는 요청을 거부하면서 교육 및 방어적 사용 사례에 도움이 되도록 유지하고 있습니다. 이러한 보호를 검증하기 위해, 회사는 전문 레드 팀링 조직과 협력하여 엔드-투-엔드 평가를 수행하고, 결단력 있고 잘 갖춰진 적대자를 시뮬레이션하여 보안 격차를 식별하고 수정합니다.
방어적 탄력성을 위한 생태계 이니셔티브
OpenAI는 책임 있는 복구를 가속화하고 수비자에게 고급 도구를 제공하기 위해 여러 이니셔티브를 출시하고 있습니다.
Aardvark 에이전틱 보안 연구원
Aardvark는 현재 비공개 베타 단계에 있는 에이전틱 보안 연구원입니다. 코드베이스를 스캔하고 패치를 제안함으로써 개발자와 보안 팀이 대규모로 취약점을 찾아 수정하도록 설계되었습니다. Aardvark는 이미 오픈소스 소프트웨어에서 새로운 CVE를 식별했습니다. OpenAI는 소프트웨어 공급망을 보호하기 위해 선택된 비상업적 오픈소스 저장소에 무료 보호를 제공할 계획입니다.
신뢰할 수 있는 접근 및 자문 위원회
OpenAI는 최신 모델의 향상된 기능에 대한 계층적 접근을 제공하는 신뢰할 수 있는 접근 프로그램을 도입하여 자격 있는 사이버 방위 사용자에게 제공합니다. 또한, 회사는 경험이 풍부한 사이버 방위자 및 보안 전문가로 구성된 Frontier Risk Council이라는 자문 그룹을 설립하여 책임 있는 능력과 잠재적 오용 사이의 경계를 조언할 것입니다.
산업 전반 협업
모든 프론티어 모델에서의 사이버 오용 위험을 해결하기 위해, OpenAI는 Frontier Model Forum을 통해 다른 연구소와 협력합니다. 이 비영리 노력은 위협 모델에 대한 공통된 이해를 개발하고, 무기화 경로를 식별하며, 위협 행위자에게 중요한 병목 현상을 식별하는 데 중점을 둡니다. OpenAI는 또한 외부 팀과 협력하여 독립적인 사이버 보안 평가를 개발하여 업계 전반에서 모델 능력에 대한 공통된 이해를 구축하고 있습니다.