openai/openai-cua-sample-app

Learn how to use CUA (our Computer Using Agent) via the API on multiple computer environments.

What it solves

이 프로젝트는 화면을 검사하고, 동작을 선택하며, 결과를 검증하여 소프트웨어 인터페이스를 조작해 작업을 완료할 수 있는 AI 시스템인 ""computer-use agents""를 구축하기 위한 참조 구현을 제공합니다.

How it works

시스템은 모델이 소프트웨어와 상호 작용하기 위한 코드를 작성하는 루프를 사용합니다. 지속적인 런타임(persistent runtime)이 호출 간에 상태와 헬퍼 함수를 유지하므로, 모델은 매 단계마다 모델로 왕복할 필요 없이 여러 동작을 결합하고 관찰 결과를 처리할 수 있습니다. 이 저장소에는 두 가지 별도의 구현이 포함되어 있습니다.

  • JavaScript/Playwright: Playwright 로케이터와 스크린샷을 사용하여 웹 브라우저를 제어합니다.
  • Python/PyAutoGUI: 스크린샷, 마우스 입력 및 키 입력을 통해 데스크톱 환경을 제어합니다.

Who it’s for

AI가 브라우저나 데스크톱 OS를 제어하여 작업을 수행해야 하는 에이전트 워크플로우(agentic workflows)를 구현하려는 개발자.

Highlights

  • Dual-Runtime Support: 브라우저 기반(Playwright) 및 데스크톱 기반(PyAutoGUI) 에이전트를 모두 포함합니다.
  • Persistent State: 모델 호출 간에 상태를 유지하는 런타임을 사용하여 지연 시간과 컨텍스트 사용량을 줄입니다.
  • Scenario Labs: 에이전트를 테스트하고 프롬프트를 작성하기 위한 실험실 템플릿(Kanban board, drawing canvas, hotel booking)이 포함되어 있습니다.
  • Traceability: 에이전트의 동작을 검토하기 위해 기록된 트레이스와 스크린샷 타임라인을 검사할 수 있는 웹 콘솔을 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트