OpenAI Operator 시스템 카드
OpenAI는 자신의 Computer-Using Agent(CUA) 모델의 연구 미리보기인 Operatorを発表했습니다. Operator는 GPT-4o의 시각 능력과 강화 학습을 결합하여 커서와 키보드를 사용해 스크린샷을 해석하고 그래픽 사용자 인터페이스(GUI)와 상호작용함으로써 사용자 감독 하에 예약하기나 식료품 주문과 같은 일상적인 브라우저 기반 작업을 수행할 수 있습니다.
기술 아키텍처 및 훈련
Operator는 인간이 하는 것처럼 컴퓨터 화면을 정확히 인식하고 상호작용하도록 설계되었습니다. 그 개발은 두 가지 주요 훈련 방법론에 의존합니다:
- Supervised Learning: 기초 수준의 인식 및 입력 제어를 확립하는 데 사용되어 모델이 화면을 읽고 UI 요소를 정확하게 클릭할 수 있게 합니다.
- Reinforcement Learning: 복잡한 추론, 오류 수정, 예기치 못한 사건에 대한 적응과 같은 고급 능력을 개발하는 데 사용됩니다.
훈련 데이터에는 공개적으로 이용 가능한 머신러닝 데이터 세트, 웹 크롤, 그리고 인간 트레이너가 컴퓨터에서 작업 완료를 시연하여 개발한 특수 데이터 세트가 혼합되어 포함되었습니다.
안전 프레임워크 및 위험 식별
OpenAI는 다층 안전 접근법을 사용하여 세 가지 주요 위험 벡터, 즉 잘못된 사용자(유해한 작업), 잘못된 모델(실수), 잘못된 웹사이트(프롬프트 주입)를 해결합니다.
프론티어 위험 평가
OpenAI의 준비 프레임워크 하에서 평가된 Operator의 위험 수준은 다음과 같습니다:
- CBRN (Chemical, Biological, Radiological, and Nuclear): 낮음. 바이오리스크 도구 평가에서 Operator는 1%의 성공률을 달성했으며 OCR과 긴 DNA 시퀀스 처리에 어려움을 겪었습니다.
- Cybersecurity: 낮음(GPT-4o에서 상속).
- Persuasion: 중간(GPT-4o에서 상속).
- Model Autonomy: 낮음. 자율 복제 테스트에서 모델은 시각 전용 입력 방식 때문에 코드 편집 및 터미널 작업에서 어려움을 겪었으며 모든 주요 작업에서 10% 미만의 점수를 받았습니다.
유해한 작업 완화
Operator는 유해한 작업을 거부하도록 훈련되어 내부 평가 세트에서 에이전트적 해악(불법 활동이나 금지된 금융 거래 등)에 대해 97%의 거부율을 달성했습니다. 시스템 수준의 제한은 모델이 금지된 활동을 촉진하는 웹사이트로 이동하는 것을 방지합니다. 특정 금지된 사용 사례에는 다음이 포함됩니다:
- 불법 활동을 촉진하거나 프라이버시를 침해하는 행위
- 타인을 사기, 속임수, 또는 가장하는 행위
- 주요 결과가 있는 규제된 활동(예: 주식 거래)의 자동화
- 타인을 괴롭히거나 명예를 훼손하는 데 사용되는 콘텐츠 생성
모델 오류 해결
되돌릴 수 없는 오류(예: 잘못된 수신자에게 이메일 보내기)를 방지하기 위해 OpenAI는 여러 가지 보호 장치를 구현했습니다:
- Confirmations: 사용자 확인을 요청하여 세계 상태를 변경하는 행동을 최종화하기 전에 모델이 설계되었습니다. 이 메커니즘은 20개의 위험한 행동 카테고리에서 92%의 재현율을 달성했습니다.
- Proactive Refusals: 은행 거래와 같은 고위험 작업은 사전에 거부되며 94%의 재현율을 보입니다.
- Watch Mode: 민감한 사이트(예: 이메일 서비스)의 경우, 사용자가 비활성 상태가 되거나 페이지에서 벗어날 경우 Operator가 자동으로 실행을 일시停止합니다.
프롬프트 주입에 대한 방어
프롬프트 주입은 타사 웹사이트에서 발견된 악성 지시를 모델이 따를 때 발생합니다. OpenAI는 모델 수준의 강건성을 통해 취약성을 62%(무방비)에서 23%로 줄였습니다. 또한 전용 prompt injection monitor가 구현되어 의심되는 공격 중에 실행을 탐지하고 일시停止하는 데 99%의 재현율과 90%의 정밀도를 달성했습니다.
API 가용성 및 개발자 안내
2025년 3월 11일 기준으로, CUA 모델은 선택된 개발자(Tiers 3-5)에게 computer-use-preview 로 제공됩니다. OpenAI는 현재 비브라우저 환경에서 모델의 신뢰도가 낮으며 OSWorld에서 38.1%의 성공률을 보인다고 언급합니다.
- Containerized Starter Setup: 고립된 환경 사용을 장려하는 Docker 애플리케이션.
- Safety Checks: API에 프롬프트 주입 및 민감한 도메인 검사 통합.
- Enhanced Monitoring: 의심스러운 사용 패턴 및 정책 위반 탐지 확대.
현재 제한 사항
Operator는 초기 단계에 있으며 짧고 반복 가능한 작업에서 가장 잘 수행됩니다. 현재 캘린더와 슬라이드쇼와 같은 복잡한 환경에서 어려움을 겪고 있습니다. 적대적 강건성이 여전히 미해결 연구 문제이기 때문에 OpenAI는 제한된 연구 미리보기 출시에서의 실제 세계 관찰을 기반으로 안전 조치를 지속적으로 개선하고 있습니다.
Sources
- OriginalOperator System Card