OpenAI와 미국 CAISI 및 영국 AISI의 보안 협력

미국 CAISI와 함께 에이전트 AI 시스템 보안 강화

OpenAI는 CAISI와 협력하여 에이전트 AI 시스템의 보안을 평가했으며, 특히 ChatGPT Agent 제품에 초점을 맞추었습니다. 이 협업에는 사이버보안 및 AI 에이전트 보안 전문가들로 구성된 다학제 팀이 참여했으며, 이들은 시스템 아키텍처에 조기 접근 권한을 받아 취약점을 식별했습니다.

복합 익스플로잇 체인 발견

CAISI는 ChatGPT Agent에서 두 가지 새로운 보안 취약점을 발견했습니다. 처음에는 악용이 불가능해 보였지만, CAISI는 이러한 전통적인 소프트웨어 취약점과 AI 에이전트 하이재킹 공격을 결합하면 AI 기반 보안 보호를 우회할 수 있음을 밝혀냈습니다. 이로 인해 성공률이 약 50%인 완전한 익스플로잇 체인이 생성되었습니다.

성공할 경우, 이러한 공격은 정교한 공격자가 다음을 할 수 있게 했을 것입니다:

  • 세션 중 에이전트가 접근한 컴퓨터 시스템을 원격으로 제어
  • 사용자가 로그인한 다른 웹사이트에서 사용자를 가장

OpenAI는 이 취약점들이 보고된 후 영업일 기준 하루 이내에 수정되었다고 보고했습니다.

영국 AISI와 함께 생물보안 방어책 강화

5월에 영국 AI 보안 연구소(UK AISI)는 GPT-5와 ChatGPT Agent를 모두 포함한 OpenAI의 생물학적 오용 방지 방어책에 대한 레드팀을 시작했습니다. 이는 단일 출시와 연결되지 않고 방어 스택을 지속적으로 개선하기 위한 지속적인 협업입니다.

철저한 테스트를 위한 깊은 시스템 접근

철저한 평가를 위해 UK AISI는 비공개 리소스에 대한 고급 접근 권한을 부여받았습니다, 포함:

  • 방어 시스템의 비공개 프로토타입
  • 가드레일이 제거된 “도움만 제공” 모델 변형
  • 생물학적 오용에 대한 내부 정책 가이드라인
  • 내부 안전 모니터 모델의 사고 흐름(Chain of Thought, CoT) 접근
  • 테스트 중 완화 조치와 집행을 선택적으로 비활성화할 수 있는 기능

결과 및 반복적 개선

UK AISI는 10여 건 이상의 상세 취약점 보고서를 식별했습니다. 이러한 발견은 여러 유형의 개선으로 이어졌습니다:

  • 엔지니어링 수정: 취약점 보고서를 기반으로 한 직접적인 제품 수정
  • 정책 집행: 정책 집행을 위한 구현 수정
  • 정책 교육: 분류기를 개선하기 위한 집중 교육
  • 모니터링 견고성: UK AISI가 식별한 범용 탈옥에 대비하기 위한 모니터링 스택 개선
  • 구성 수정: 악성 콘텐츠가 모더레이션을 트리거하지 않고 유출되거나 입력될 수 있는 구성 취약점 해결

UK AISI는 전체 모더레이션 시스템의 방어책이 크게 강화되었다고 결론지었습니다. 반복 기간이 끝날 무렵, 범용 공격을 만들려면 정교한 기술과 다수의 모더레이션 플래그가 필요했으며, 이는 악의적인 행위자가 플래그가 지정되고 차단될 가능성이 높다는 것을 의미합니다.

공공-민간 보안 파트너십의 전략적 함의

이러한 협업은 정부의 국가 안보 전문성과 민간 AI 개발의 깊은 통합 모델을 보여줍니다. OpenAI는 이러한 파트너십이 여러 핵심 이점을 제공한다고 언급합니다:

  • 국가 안보 전문성: 머신러닝 및 계측 분야의 정부 전문 지식에 접근함으로써 다른 사람들이 놓칠 수 있는 문제를 식별할 수 있습니다.
  • 기술적 기반: 실무 경험을 통해 정부는 기술적으로 기반을 둔 모범 사례를 개발하여 산업 전반의 보안을 가속화할 수 있습니다.
  • 책임성과 신뢰: 외부 전문가 분석은 배포된 시스템에 대한 신뢰와 책임성을 구축합니다.
  • 지속적인 평가: 지속적인 협업은 일회성 사전 배포 평가보다 더 큰 가치를 제공합니다.

Sources