openai/openai-cua-sample-app

Learn how to use CUA (our Computer Using Agent) via the API on multiple computer environments.

What it solves

このプロジェクトは、「computer-use agents」(画面を検査し、アクションを選択し、結果を検証することでソフトウェアインターフェースを操作してタスクを完了できるAIシステム)を構築するためのリファレンス実装を提供します。

How it works

システムは、モデルがソフトウェアと対話するためのコードを記述するループを使用します。永続的なランタイム(persistent runtime)が呼び出し間で状態とヘルパー関数を維持するため、モデルはすべてのステップでモデルへの往復通信を行う必要なく、複数のアクションを組み合わせたり観測結果を処理したりできます。このリポジトリには2つの異なる実装が含まれています。

  • JavaScript/Playwright: Playwright のロケーターとスクリーンショットを使用して Web ブラウザを制御します。
  • Python/PyAutoGUI: スクリーンショット、マウス入力、キー入力を使用してデスクトップ環境を制御します。

Who it’s for

AI がブラウザやデスクトップ OS を制御してタスクを実行する必要があるエージェンティック・ワークフロー(agentic workflows)の実装を検討している開発者。

Highlights

  • Dual-Runtime Support: ブラウザベース(Playwright)とデスクトップベース(PyAutoGUI)の両方のエージェントが含まれています。
  • Persistent State: モデルの呼び出し間で状態を保持するランタイムを使用し、レイテンシとコンテキストの使用量を削減します。
  • Scenario Labs: エージェントをテストおよびプロンプトするためのラボテンプレート(Kanban board, drawing canvas, hotel booking)が含まれています。
  • Traceability: 記録されたトレースとスクリーンショットのタイムラインを検査してエージェントの動作を確認するための Web コンソールを提供します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト