OpenAI Astra: 핵심 사이버 역량 대응
OpenAI는 곧 출시될 Astra 모델에 대한 내부 평가 결과, 에이전트 기반 코딩 및 사이버 보안 분야에서 상당한 진전이 있음을 발표했습니다. 이러한 결과로 인해 OpenAI는 Astra가 회사의 Preparedness Framework에서 정의한 "Critical" 사이버 역량 임계값에 도달했을 가능성을 배제할 수 없다는 결론을 내렸습니다.
핵심 사이버 보안 임계값 정의
모델이 다음과 같은 작업을 인간의 개입 없이 수행할 수 있을 때 핵심(Critical) 사이버 보안 임계값에 도달한 것으로 분류됩니다:
- 많은 강화된 실제 핵심 시스템에서 모든 심각도 수준의 기능적인 zero-day exploits를 식별하고 개발함.
- 단순히 높은 수준의 목표만을 바탕으로 강화된 대상에 대한 사이버 공격을 위한 엔드투엔드(end-to-end)의 새로운 전략을 고안하고 실행함.
평가가 진행 중이지만, Astra에 대한 예비 결과는 이 Critical 수준을 배제할 수 없을 만큼 강력한 성능을 나타냅니다. OpenAI는 Astra가 Hugging Face의 취약점 공격에 관여하지 않았음을 명시적으로 밝혔습니다.
보안 제어 및 완화 단계
이러한 역량과 관련된 위험을 관리하기 위해 OpenAI는 안전장치 및 보안 제어에 대한 견고성 테스트를 확대하고 있습니다. 회사는 고성능 모델을 위해 다음과 같은 여러 내부 보안 조치를 시행하고 있습니다:
- Infrastructure Protections: 격리된 테스트 환경 구현, 제한된 네트워크 및 도구 액세스, 강화된 암호화 및 모델 가중치 보호, 그리고 샌드박스 실행.
- Activity Pauses: 이러한 강화된 보안 요구 사항을 충족하지 못하는 Astra 관련 내부 활동은 현재 일시 중단되었습니다.
- Universal Monitoring: 훈련 및 평가를 포함하여 Astra의 모든 에이전트 기반 애플리케이션 전반에 걸쳐 위험한 행동 및 정렬 불량(misalignment)을 모니터링하는 시스템을 구현합니다. 이러한 모니터는 모델의 Chain of Thought를 분석하여 보안 대응을 트리거하고 고위험 활동을 중단시킵니다.
- External Collaboration: OpenAI는 정부 기관 및 선정된 AI 안전 조직과 협력하여 모델의 역량을 테스트할 것입니다.
- Third-Party Guidance: 회사는 고위험 평가 및 워크로드가 안전하게 실행되도록 보장하기 위해 제3자 테스트 파트너에게 권장 보안 제어를 제공할 것입니다.
문맥 및 Preparedness Framework
2023년 12월에 발표된 OpenAI의 Preparedness Framework는 생물학, 화학, 사이버 보안, AI 자가 개선과 같은 도메인 전반의 역량 진전을 식별하는 가이드 역할을 합니다. GPT-5.6-Sol을 포함한 이전 모델들은 프런티어 사이버 역량에 대해 "High" (Critical이 아닌) 임계값으로 평가되었습니다.
이 대응은 생물학 분야의 높은 역량 임계값에 도달하는 모델들에 관한 2025년 6월 발표와 유사한 프로토콜을 따릅니다. 당시 OpenAI는 역량을 책임감 있게 배포하기 위해 안전장치를 강화하고 테스트를 확대했습니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch