OpenAI Operator 시스템 카드

OpenAI는 자신의 Computer-Using Agent(CUA) 모델의 연구 미리보기인 Operatorを発表했습니다. Operator는 GPT-4o의 시각 능력과 강화 학습을 결합하여 커서와 키보드를 사용해 스크린샷을 해석하고 그래픽 사용자 인터페이스(GUI)와 상호작용함으로써 사용자 감독 하에 예약하기나 식료품 주문과 같은 일상적인 브라우저 기반 작업을 수행할 수 있습니다.

기술 아키텍처 및 훈련

Operator는 인간이 하는 것처럼 컴퓨터 화면을 정확히 인식하고 상호작용하도록 설계되었습니다. 그 개발은 두 가지 주요 훈련 방법론에 의존합니다:

  • Supervised Learning: 기초 수준의 인식 및 입력 제어를 확립하는 데 사용되어 모델이 화면을 읽고 UI 요소를 정확하게 클릭할 수 있게 합니다.
  • Reinforcement Learning: 복잡한 추론, 오류 수정, 예기치 못한 사건에 대한 적응과 같은 고급 능력을 개발하는 데 사용됩니다.

훈련 데이터에는 공개적으로 이용 가능한 머신러닝 데이터 세트, 웹 크롤, 그리고 인간 트레이너가 컴퓨터에서 작업 완료를 시연하여 개발한 특수 데이터 세트가 혼합되어 포함되었습니다.

안전 프레임워크 및 위험 식별

OpenAI는 다층 안전 접근법을 사용하여 세 가지 주요 위험 벡터, 즉 잘못된 사용자(유해한 작업), 잘못된 모델(실수), 잘못된 웹사이트(프롬프트 주입)를 해결합니다.

프론티어 위험 평가

OpenAI의 준비 프레임워크 하에서 평가된 Operator의 위험 수준은 다음과 같습니다:

  • CBRN (Chemical, Biological, Radiological, and Nuclear): 낮음. 바이오리스크 도구 평가에서 Operator는 1%의 성공률을 달성했으며 OCR과 긴 DNA 시퀀스 처리에 어려움을 겪었습니다.
  • Cybersecurity: 낮음(GPT-4o에서 상속).
  • Persuasion: 중간(GPT-4o에서 상속).
  • Model Autonomy: 낮음. 자율 복제 테스트에서 모델은 시각 전용 입력 방식 때문에 코드 편집 및 터미널 작업에서 어려움을 겪었으며 모든 주요 작업에서 10% 미만의 점수를 받았습니다.

유해한 작업 완화

Operator는 유해한 작업을 거부하도록 훈련되어 내부 평가 세트에서 에이전트적 해악(불법 활동이나 금지된 금융 거래 등)에 대해 97%의 거부율을 달성했습니다. 시스템 수준의 제한은 모델이 금지된 활동을 촉진하는 웹사이트로 이동하는 것을 방지합니다. 특정 금지된 사용 사례에는 다음이 포함됩니다:

  • 불법 활동을 촉진하거나 프라이버시를 침해하는 행위
  • 타인을 사기, 속임수, 또는 가장하는 행위
  • 주요 결과가 있는 규제된 활동(예: 주식 거래)의 자동화
  • 타인을 괴롭히거나 명예를 훼손하는 데 사용되는 콘텐츠 생성

모델 오류 해결

되돌릴 수 없는 오류(예: 잘못된 수신자에게 이메일 보내기)를 방지하기 위해 OpenAI는 여러 가지 보호 장치를 구현했습니다:

  • Confirmations: 사용자 확인을 요청하여 세계 상태를 변경하는 행동을 최종화하기 전에 모델이 설계되었습니다. 이 메커니즘은 20개의 위험한 행동 카테고리에서 92%의 재현율을 달성했습니다.
  • Proactive Refusals: 은행 거래와 같은 고위험 작업은 사전에 거부되며 94%의 재현율을 보입니다.
  • Watch Mode: 민감한 사이트(예: 이메일 서비스)의 경우, 사용자가 비활성 상태가 되거나 페이지에서 벗어날 경우 Operator가 자동으로 실행을 일시停止합니다.

프롬프트 주입에 대한 방어

프롬프트 주입은 타사 웹사이트에서 발견된 악성 지시를 모델이 따를 때 발생합니다. OpenAI는 모델 수준의 강건성을 통해 취약성을 62%(무방비)에서 23%로 줄였습니다. 또한 전용 prompt injection monitor가 구현되어 의심되는 공격 중에 실행을 탐지하고 일시停止하는 데 99%의 재현율과 90%의 정밀도를 달성했습니다.

API 가용성 및 개발자 안내

2025년 3월 11일 기준으로, CUA 모델은 선택된 개발자(Tiers 3-5)에게 computer-use-preview 로 제공됩니다. OpenAI는 현재 비브라우저 환경에서 모델의 신뢰도가 낮으며 OSWorld에서 38.1%의 성공률을 보인다고 언급합니다.

  • Containerized Starter Setup: 고립된 환경 사용을 장려하는 Docker 애플리케이션.
  • Safety Checks: API에 프롬프트 주입 및 민감한 도메인 검사 통합.
  • Enhanced Monitoring: 의심스러운 사용 패턴 및 정책 위반 탐지 확대.

현재 제한 사항

Operator는 초기 단계에 있으며 짧고 반복 가능한 작업에서 가장 잘 수행됩니다. 현재 캘린더와 슬라이드쇼와 같은 복잡한 환경에서 어려움을 겪고 있습니다. 적대적 강건성이 여전히 미해결 연구 문제이기 때문에 OpenAI는 제한된 연구 미리보기 출시에서의 실제 세계 관찰을 기반으로 안전 조치를 지속적으로 개선하고 있습니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch