OpenAI 사이버 보안 핵심 역량을 위한 모델 개발 속도 조절
OpenAI는 더욱 엄격한 보안 및 정렬(alignment) 안전장치를 구현하기 위해 모델 스케일링 속도를 일시적으로 늦추고 특정 강화 학습(RL) 훈련 과정을 중단했습니다. 이번 결정은 OpenAI-Hugging Face 보안 사고와 차기 Astra 모델이 OpenAI의 Preparedness Framework에서 정의된 "Critical cybersecurity capability" 임계값에 도달할 수 있다는 예비 증거가 발견됨에 따라 내려졌습니다.
연구 환경 보안 강화
OpenAI는 무단 액세스를 방지하고 고급 사이버 보안 역량을 갖춘 모델로부터 보호하기 위해 훈련 및 평가 환경에 대한 보안 표준을 높이고 있습니다. OpenAI-Hugging Face 사고 이후, 연구 클러스터 내에서 코드를 실행하거나 인터넷에 접속할 수 있는 모든 프런티어 모델 추론 과정을 중단했습니다.
심층 방어(defense in depth)를 구축하기 위해 OpenAI는 다음과 같은 통제 조치를 구현했습니다:
- Workload Isolation: 모델이 생성한 코드나 신뢰할 수 없는 코드를 실행하는 워크로드 및 모델 출력을 처리하는 소프트웨어에 대해 더 강력한 "sandboxes" 사용이 이제 필수적입니다.
- Network Isolation: 새로운 통제 조치를 통해 고위험 워크로드를 인터넷으로부터 격리하여, 단일 서비스의 침해로 인해 내부 네트워크나 웹에 대한 무단 액세스가 허용되지 않도록 보장합니다.
- Continuous Security Testing: OpenAI는 취약한 공유 서비스를 제거하고, 상시 권한을 축소하며, 보안 로그 모니터링을 개선했습니다. 또한 연구소는 시뮬레이션된 공격을 통해 이러한 경계의 지속적인 테스트를 자동화하기 위해 자체 모델을 사용하고 있습니다.
이러한 가장 엄격한 안전장치는 현재 모든 사이버 관련 워크로드와 Astra 모델을 포함하는 워크로드에 대해 의무적으로 적용됩니다. 많은 Astra 워크로드는 이러한 강화된 환경으로 이전될 때까지 중단된 상태로 유지됩니다.
다단계 사고 연쇄(Chain-of-Thought) 모니터링
OpenAI는 프런티어 RL 훈련 및 평가와 같은 고위험 워크로드에서 우려되는 모델 행동을 실시간으로 감지하기 위해 모니터링 시스템을 확장했습니다.
새로운 모니터링 아키텍처는 다음과 같은 단계로 작동합니다:
- Activation Classifiers: 이 탐지기는 모든 샘플링된 토큰에서 내부 모델 활동을 검사합니다.
- Automated Investigators: 잠재적인 우려 사항은 도구 사용, 추론, 활동 시퀀스를 분석하여 데이터 도난, 파괴적 행동, 무단 액세스 또는 안전장치 우회 시도 징후를 조사하기 위해 고성능 컴퓨팅을 사용하는 조사관(investigators)에게 전달됩니다.
OpenAI는 우려되는 활동이 감지된 후 30분 이내에 경고를 발행하는 것을 목표로 합니다. 만약 심각한 보안 경계 위반이 의심되고 30분 이내에 오탐(false positive)으로 판명되지 않을 경우, 안전, 보안 및 연구 팀은 해당 활동을 중단해야 합니다. 이 모니터링은 "Sol capability" 이상의 모델에 대한 모든 RL 훈련 및 평가에 의무적이며, 8월 7일 이후로는 도구를 사용하는 모든 Astra 추론에 대해 필수적으로 적용됩니다.
Compute Overhead: 이 모니터링 시스템은 현재 모니터링 대상인 추론 컴퓨팅의 약 20%를 요구합니다.
정렬(Alignment) 및 리스크 완화 기술의 발전
보상 해킹(reward hacking), 기만(deception), 무단 액세스 등의 리스크를 방지하기 위해, OpenAI는 가장 유능한 모델들의 훈련 과정 중 더 많은 단계에 핵심 정렬 기술을 다음과 같이 통합하고 있습니다.
주요 집중 분야는 다음과 같습니다:
- Reward Model Improvement: 다양한 환경에서 안전하지 않은 행동을 더 잘 감지하고 억제하기 위해 보상 모델을 개선합니다.
- Honesty Training: 모델이 자신의 행동, 역량 및 한계에 대해 더 투명하게 공개하도록 훈련합니다.
- Exploit Reduction: 도구, 채점자, 보상 또는 인간의 감독을 악용하는 행동을 다음과 같이 줄입니다.
- Expanded Coverage: 모델이 외부 리소스와 상호작용할 때 해를 끼칠 수 있는 행동에 대한 훈련 범위를 확대합니다.
Preparedness Framework의 미래 진화
OpenAI는 이러한 안전장치를 훈련과 배포 모두에 단계적으로 통합하여 Preparedness Framework를 진화시킬 계획입니다. 연구소는 모델 지원 보안(model-assisted security)에 투자하고 그 결과를 외부 조직과 공유할 것입니다. 이러한 학습 내용을 상세히 기술한 기술 보고서가 향후 몇 주 내에 발표될 예정입니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch