OpenAI가 ChatGPT 에이전트를 소개합니다
OpenAI는 자체 가상 컴퓨터를 운영하여 복잡하고 종단 간 작업을 실행할 수 있는 시스템인 ChatGPT 에이전트를 소개했습니다. Operator의 웹 상호작용 기능, deep research의 종합 능력, 그리고 ChatGPT의 대화 유창성을 통합함으로써, 이 에이전트는 웹사이트를 탐색하고 코드를 실행하며 슬라이드쇼와 스프레드시트와 같은 편집 가능한 전문 산출물을 제공할 수 있습니다.
통합 에이전트 아키텍처
ChatGPT 에이전트는 이전에 별개였던 세 가지 기능을 하나의 모델로 통합한 통합 시스템 위에 구축되었습니다. 이 통합을 통해 에이전트는 추론과 행동 사이를 유연하게 전환할 수 있게 되었으며, Operator가 깊은 분석 깊이가 부족하고 deep research가 웹사이트와 상호작용하거나 인증된 콘텐츠를 처리할 수 없었던 이전의 제한을 극복합니다.
도구 모음 및 기술 실행
To perform tasks, the agent utilizes a virtual computer equipped with a specific suite of tools:
- Visual Browser: 인간 중심 웹사이트를 위한 그래픽 사용자 인터페이스(GUI)를 통해 웹과 상호작용합니다.
- Text-based Browser: 효율성을 위해 보다 단순하고 추론 기반의 웹 쿼리를 처리합니다.
- Terminal: 명령을 실행하고 코드를 실행합니다.
- Direct API Access: 구조화된 데이터 검색을 위해 서비스에 연결합니다.
- ChatGPT Connectors: GitHub 및 Gmail과 같은 앱과 통합하여 사용자별 정보를 접근합니다.
This architecture allows the model to choose the most efficient path for a task. For example, it can retrieve calendar data via API, reason over text using the text browser, and interact with a GUI for final execution.
성능 벤치마크
ChatGPT agent demonstrates state-of-the-art (SOTA) performance across several expert-level and real-world benchmarks:
- Humanity’s Last Exam (HLE): pass@1 SOTA 점수 41.6을 달성했으며, 병렬 롤아웃 전략(8회 시도) 사용 시 44.4로 상승합니다.
- FrontierMath: 터미널 접근을 통한 코드 실행으로 27.4% 정확도를 달성했으며, 이전 모델보다 크게 앞섭니다.
- BrowseComp: 새로운 SOTA 68.9%를 기록했으며, 이는 deep research 대비 17.4%p 상승한 수치입니다.
- SpreadsheetBench: 스프레드시트를 직접 편집할 수 있는 능력을 부여받아 45.5% 점수를 기록, Excel용 Copilot의 20.0%보다 우수했습니다.
- WebArena: Operator를 구동하는 o3 기반 CUA보다 개선된 성능을 보였습니다.
- Investment Banking Tasks: 레버리지 바이아웃 모델 등 1~3년 차 애널리스트 모델링 작업에 대한 내부 벤치마크에서 deep research와 o3를 크게 앞섰습니다.
- Knowledge Work: 경제적으로 가치 있는 지식 작업에 대한 내부 벤치마크에서, 에이전트의 결과물은 약 절반의 경우에 인간과 동등하거나 더 우수했습니다.
사용자 제어 및 협업 워크플로우
ChatGPT agent is designed for iterative collaboration rather than autonomous isolation. Users maintain control through several mechanisms:
- Interruption and Takeover: 사용자는 언제든지 에이전트를 중단하고 지시를 명확히 하거나 브라우저를 수동으로 인수하여 로그인 처리나 결과를 조정할 수 있습니다.
- Permission-based Actions: 에이전트는 구매와 같은 실제 영향을 미치는 행동을 수행하기 전에 명시적인 허가를 요청하도록 훈련되었습니다.
- Watch Mode: 이메일 전송과 같은 중요한 작업은 사용자의 적극적인 감독이 필요합니다.
- Notifications: 모바일 앱 사용자는 작업 완료 시 알림을 받습니다.
- Scheduling: 사용자는 완료된 작업을 자동으로 반복하도록 예약할 수 있습니다(예: 주간 보고서).
안전 및 위험 완화
OpenAI는 웹에서 직접 행동을 취할 수 있는 에이전트의 확대된 위험 프로필을 다루기 위해 포괄적인 안전 스택을 구현했습니다.
적대적 조작 및 프롬프트 인젝션
Because the agent encounters live web content, it is susceptible to prompt injection—where malicious instructions hidden in webpages trick the agent into sharing private data or taking harmful actions. Mitigations include:
- 프롬프트 인젝션을 식별하고 저항하도록 특화된 훈련.
- 공격을 탐지하기 위한 지속적인 모니터링.
- 중요한 행동에 대한 명시적인 사용자 확인 요구.
모델 오류 및 데이터 프라이버시
To prevent autonomous errors, the agent proactively refuses high-risk tasks like bank transfers. Privacy is managed through "takeover mode," where inputs (such as passwords) remain private and are not collected or stored by the model. Users can also delete all browsing data and log out of all sessions with a single click.
생물학 및 화학 위험
Under the Preparedness Framework, ChatGPT agent is classified as having "High Biological and Chemical capabilities." This triggers a comprehensive safety stack including dual-use refusal training, reasoning monitors, and always-on classifiers.
가용성 및 제한 사항
ChatGPT 에이전트는 현재 도구 드롭다운의 "agent mode" 옵션을 통해 Pro, Plus, Team 사용자에게 순차적으로 제공되고 있습니다. 기업 및 교육 사용자는 향후 몇 주 내에 접근 권한을 받게 됩니다. Pro 사용자는 월 400개의 메시지로 제한되며, 기타 유료 사용자는 월 40개의 메시지를 받습니다.
Current Limitations:
- Slideshow Creation: 현재 베타 단계입니다. 형식과 다듬기가 기본적일 수 있으며, 기존 슬라이드쇼를 템플릿으로 업로드하는 기능은 아직 지원되지 않습니다(스프레드시트와는 달리).
- Regional Availability: 스위스와 유럽 경제 지역에 대한 접근이 아직 활성화 중입니다.
SUMMARY: OpenAI는 웹 상호작용, 심층 연구, 대화형 인텔리전스를 결합한 통합 에이전트 시스템인 ChatGPT 에이전트를 출시하여 가상 컴퓨터에서 복잡하고 다단계 작업을 수행합니다.
TITLE: OpenAI가 ChatGPT 에이전트를 소개합니다
Sources
- OriginalIntroducing ChatGPT agent