OpenAI, 사이버 핵심 능력 우려로 전면 모델 학습을 일시 중단하고 보안 강화

OpenAI, 등장하는 사이버 핵심 능력으로 인해 전면 모델 학습 일시 중단

OpenAI는 내부 신호가 다음 Astra 모델의 학습 과정에서 핵심 사이버 보안 능력 기준에 도달할 수 있음을 시사함에 따라, 계획된 가장 큰 강화 학습(RL) 실행을 중단했다. 이후 보안, 정렬, 모니터링 강화를 위해 추가 조치를 취한 후 재개할 예정이다.


중단 결정의 의미

OpenAI의 결정은 전면 AI 연구소들이 등장하는 모델 능력을 추상적 우려가 아닌 실질적 위험으로 간주하고 있음을 보여준다. 고위험 강화 학습 학습을 중단함으로써 OpenAI는 강력한 보안 조치가 검증되기 전에 자율 해킹 능력을 가진 모델이 배포되는 것을 막고자 한다.


연구 및 배포 전반에 걸친 새로운 보안 조치

OpenAI는 안전성 스택을 세 가지 상호 연결된 기둥으로 구성한다:

  1. 모니터링 – 위험한 행동을 실시간으로 탐지.
  2. 정렬 – 모델이 의도된 목적을 따르도록 훈련.
  3. 보안 조치 – 격리 및 접근 제어.

이 세 가지 기둥은 이제 모든 작업에 동일하게 적용되며, 사이버 핵심 잠재력을 보이는 모델에 대해 더 엄격한 기준이 적용된다.


연구 환경 보안 강화

  • 작업 격리 – 모델이 생성하거나 입력받는 코드에 대해 더 강력한 샌드박싱.
  • 네트워크 격리 – 손상된 작업이 인터넷이나 내부 네트워크에 접근하는 것을 방지하기 위한 강화된 통제.
  • 지속적인 보안 테스트 – 공유 서비스 제거, 상시 권한 감소, 모델 자체를 활용한 자동 공격 시뮬레이션.

OpenAI는 Astra 관련 모든 작업이 최고 수준의 보안 기준을 충족해야 한다고 밝혔다. 아직 이 기준을 충족하지 못한 작업은 일시 중단된 상태이며, 안전성에 중요한 작업은 우선적으로 이전된다.

"연구 클러스터에서 코드 실행 또는 인터넷에 접근할 수 있는 도구를 사용할 수 있는 실행을 위해 전면 모델 추론을 일시 중단했습니다…" – OpenAI 블로그 게시물


확장된 사고 흐름 모니터링

OpenAI의 새로운 모니터링 파이프라인은 여러 단계로 구성된다:

  • 활성화 분류기 – 샘플링된 각 토큰에서 모델 내부 활동을 검사.
  • 자동 조사팀 – 도구 사용, 추론 흐름, 전체 활동 시퀀스를 분석하여 무단 행동, 데이터 도용, 보안 조치 회피 시도 여부를 확인.
  • 경고 프로토콜 – 잠재적 위반을 감지하면 고우선순위 경고를 발행하고, 안전성, 보안, 연구 팀이 즉시 대응한다. 30분 이내에 경고를 해제할 수 없으면 활동이 일시 중단된다.

현재 모니터링은 보호하는 작업의 컴퓨팅에 약 20%의 오버헤드를 추가한다. 이 시스템은 모든 강화 학습 학습 및 도구 사용 평가(‘Sol’ 능력 이상 모델) 및 모든 Astra 도구 기반 추론에 필수적이다.


정렬 연구 가속화

OpenAI는 가장 강력한 모델의 훈련 파이프라인 전반에 핵심 정렬 기법을 확장하고 있다:

  • 개선된 보상 모델 – 다양한 작업에서 안전하지 않은 행동에 더 효과적으로 벌점을 부과.
  • 정직성 훈련 – 모델이 자신의 능력과 행동에 대해 더 정직하게 설명하도록 훈련.
  • 보상 조작 방지 – 평가 또는 도구 사용의 허점 악용을 줄이기 위한 조치.
  • 외부 시스템과의 상호작용에 대한 폭넓은 평가 커버리지.

연구소는 정렬되지 않은 행동(예: 속임수를 사용한 도구 사용, 무단 접근)이 모델의 사이버 공격 능력이 증가함에 따라 위험도가 점점 커진다고 강조한다.


Hacker News 커뮤니티 반응

  • 벤치마크에 대한 회의론 – 사용자들은 GLM 5.2와 같은 오픈웨이트 모델이 CyberBench 테스트에서 77%를 기록하며 Astra의 88%에 근접했지만, 전 세계적으로 사이버 사고가 발생하지 않았다는 점을 지적했다. 이는 위협이 과장되었는지, 아니면 현재 방어가 효과적이라는 논의를 촉발했다.

    "Sol이 세계 종말급으로 위험하다면, GLM 5.2는 90% 정도 되어야 하지 않나요? 왜 매일 매일 광범위한 GLM 기반 해킹은 일어나지 않는 걸까요?" – @red_green_yell

  • 경고 신호 – 여러 사용자는 중단을 "탄광의 카나리새"로 묘사하며, 전면이 더 이상 진행되기 어려운 위험한 지점에 도달했다고 강조했다.

    "우리는 전면의 전면에 도달했고, 더 이상 나아갈 수 없게 되었어요. 왜냐하면 더 나아가는 것이 실제로 위험해졌기 때문이죠." – @bottlepalm

  • 보안 우선 관점 – 일부는 진짜 문제는 운영 보안이라고 주장하며, AI 위협은 여러 벡터 중 하나일 뿐이며 조직이 자체 시스템을 강화해야 한다고 말했다.

    "OpenAI의 두드리기는 무해하지만, 당신이 제 역할을 하지 않으면 러시아와 중국은 이미 들어와 있을 겁니다." – @miohtama

  • 구현에 대한 비판 – 여러 사용자는 왜 OpenAI가 이미 강화된 샌드박스 기술(gVisor, Firecracker 등)을 사용하지 않았는지 의문을 제기하며, 발표된 보안 조치가 사후 대응이지 선제적 설계가 아니라고 지적했다.

    "왜 gVisor, Firecracker, seccomp 등을 사용하지 않았나요? 무한한 토큰을 가진 회사로서는 용납할 수 없는 일처럼 느껴집니다." – @insanitybit

  • 프로세스 투명성 – 사용자들은 정렬 효과성에 대한 구체적인 지표가 부족하다고 지적하며, 새로운 모니터링 및 정렬 파이프라인의 성능에 대한 명확한 증거가 필요하다고 촉구했다.

    "정렬이 실제로 얼마나 잘 작동하는지 평가할 수 있는 신뢰할 수 있는 방법이 있나요?" – @musicale


OpenAI와 업계의 앞으로의 방향

OpenAI는 이러한 보안 조치를 훈련 및 배포 단계를 아우르는 업데이트된 준비 프레임워크에 통합할 계획이다. 또한 외부 파트너와 협력하고, 곧 발표할 기술 보고서를 통해 연구 결과를 공유할 예정이다.

전체 AI 커뮤니티는 함께 직면한 과제가 있다: 빠르게 발전하는 모델 능력에 맞춰 확장 가능한 모니터링, 정렬, 보안 방법을 개발하는 것이다. OpenAI의 일시 중단은 산업 전반에서 모델이 사이버 핵심 기준에 도달할 때 유사한 예방 조치를 채택해야 할 필요성을 시사한다.


주요 요약

  • OpenAI는 Astra 모델이 핵심 사이버 능력을 가질 수 있다는 초기 증거를 바탕으로 가장 큰 전면 RL 실행을 일시 중단했다.
  • 새로운 보안 조치에는 더 엄격한 샌드박싱, 네트워크 격리, 지속적인 보안 테스트, 30분 응답 시간이 있는 다단계 모니터링, 확장된 정렬 연구가 포함된다.
  • Hacker News 커뮤니티는 중단을 필수적인 안전 조치로 보는 반면, OpenAI의 보안 구현의 적절성과 시기 문제를 의심하는 의견이 공존한다.
  • 지속적인 투명성과 외부 협력은 AI 분야가 등장하는 사이버 핵심 위험을 관리하는 데 필수적이다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch