OpenAI Computer-Using Agent (CUA)와 Operator 연구 미리보기
OpenAI는 Operator의 연구 미리보기를 소개했는데, 이는 웹 기반 작업을 수행할 수 있는 에이전트입니다. 이 에이전트를 구동하는 것은 **Computer-Using Agent (CUA)**이며, 이는 강화 학습을 통한 고급 추론과 GPT-4o의 시각 기능을 결합한 모델입니다. OS- 또는 웹 특정 API에 의존하는 전통적인 에이전트와 달리, CUA는 원시 픽셀, 가상 마우스, 키보드의 범용 인터페이스를 통해 그래픽 사용자 인터페이스(GUI)와 상호작용하여 다양한 디지털 환경에서 작동할 수 있습니다.
기술 아키텍처 및 워크플로우
CUA는 다단계 작업을 완료하기 위해 인식, 추론, 행동의 반복 루프를 통해 작동합니다:
- Perception: 모델은 현재 상태의 시각적 스냅샷인 컴퓨터 화면 스크린샷을 받습니다.
- Reasoning: CUA는 사고사슬(chain-of-thought) 추론을 활용하여 관찰을 평가하고, 중간 단계를 추적하며, 현재 및 과거 스크린샷과 행동을 기반으로 동적으로 적응합니다.
- Action: 모델은 클릭, 스크롤, 타이핑 등의 행동을 실행합니다. 대부분의 단계는 자동으로 수행되지만, CAPTCHA에 응답하거나 로그인 정보를 입력하는 것과 같은 민감한 작업에 대해서는 사용자 확인이 필요합니다.
성능 벤치마크
CUA는 자신의 범용 인터페이스를 사용하여 여러 컴퓨터 및 브라우저 사용 벤치마크에서 새로운 최첨단(SOTA) 결과를 달성합니다:
| 벤치마크 | 유형 | OpenAI CUA | 이전 SOTA | 인간 성능 |
|---|---|---|---|---|
| OSWorld | 컴퓨터 사용 | 38.1% | 22.0% | 72.4% |
| WebArena | 브라우저 사용 | 58.1% | 36.2% | 78.2% |
| WebVoyager | 브라우저 사용 | 87.0% | 56.0% | N/A |
브라우저 사용 분석
CUA는 WebVoyager(87%)와 WebArena(58.1%)에서 높은 성공률을 달성했습니다. 간단한 작업에서는 성능이 좋지만, OpenAI는 WebArena와 같은 더 복잡한 벤치마크에서 인간 성과의 격차를 줄이기 위해 추가적인 개선이 필요하다고 지적합니다.
컴퓨터 사용 분석
OSWorld 벤치마크에서(전체 운영 체제(Ubuntu, Windows, macOS)의 제어를 평가하는), CUA는 38.1%의 성공률을 달성했습니다. OpenAI는 '테스트 시간 스케일링'을 관찰했는데, 이는 모델이 작업을 완료하기 위해 더 많은 단계를 허용받을수록 성능이 향상된다는 것을 의미합니다.
실제 세계의 기능과 제한
Operator 연구 미리보기를 통해, OpenAI는 CUA의 특정 강점과 약점을 식별했습니다:
Strengths: CUA는 다양한 UI 구성 요소와 상호작용하여 검색 및 필터 결과를 얻고, 반복적인 간단한 UI 상호작용(예: Todoist에서 프로젝트 및 목록 생성 또는 Spotify에서 플레이리스트 생성)을 자동화하는 데 있어 매우 신뢰할 수 있습니다(성공률 10/10).
Weaknesses: CUA는 unfamiliar한 UI와 정확한 텍스트 편집에서 어려움을 겪습니다. 예를 들어, 훈련 중에 자주 접하지 않았던 HTML 편집기를 사용할 때 성공률이 낮았습니다(4/10). 또한 복잡한 사이트별 작업에서 신뢰성을 높이기 위해 특정 힌트가 포함된 더詳細한 프롬프트가 필요합니다.
안전 및 위험 완화
오용
해로운 또는 불법적인 활동을 방지하기 위해 OpenAI는 다음과 같은 조치를 취합니다:
- Refusals: 해로운 작업을 거부하도록 모델을 훈련시킵니다.
- Blocklists: 도박, 성인 엔터테인먼트, 마약/총기 소매업체에 대한 접근을 사전에 차단합니다.
- Moderation: 아동 안전과 같은 우선 정책 영역에 대해 실시간 자동 안전 검사기와 오프라인 탐지 파이프라인을 운영합니다.
모델 실수
의도치 않은 피해(예: 문서 삭제 또는 잘못된 구매)를 방지하기 위해 시스템에는 다음이 포함됩니다:
- User Confirmations: 외부 부작용이 있는 작업을 최종화하기 전에 사용자 승인을 요구합니다.
- Task Limitations: 은행 거래와 같은 고위험 작업을 거절합니다.
- Watch Mode: 이메일과 같은 민감한 웹사이트에서 актив적인 사용자 감독을 요구합니다.
적대적 공격
웹사이트에서의 프롬프트 주입과 피싱을 방지하기 위해 CUA는 다음과 같은 방법을 사용합니다:
- Cautious Navigation: 프롬프트 주입을 식별하고 무시하도록 모델을 훈련시킵니다.
- Monitoring: 화면에서 의심스러운 콘텐츠가 감지되면 실행을 모니터링하고 일시停止하는 별도의 모델입니다.
- Detection Pipelines: 의심스러운 접근 패턴을 신속하게 플래그하기 위한 자동 및 인간 검토입니다.
미래 전망
OpenAI는 개발자가 자신만의 컴퓨터 사용 에이전트를 구축할 수 있도록 API를 통해 CUA를 제공할 계획입니다. 미국 내 Pro 사용자를 위한 현재 연구 미리보기는 실제 세계의 피드백을 수집하여 기능과 안전 조치를 개선하는 목적을 가지고 있습니다.
Sources
- OriginalComputer-Using Agent