openai/openai-cua-sample-app

Learn how to use CUA (our Computer Using Agent) via the API on multiple computer environments.

What it solves

這項專案提供了構建「電腦使用代理」(computer-use agents)的參考實作,這些是能透過檢查螢幕、選擇動作並驗證結果來操作軟體介面以完成任務的 AI 系統。

How it works

該系統使用一個迴圈,由模型編寫程式碼來與軟ware 互動。一個持久性運行時(persistent runtime)在呼叫之間維護狀態與輔助函數,讓模型可以組合多個動作並處理觀察結果,而不需要在每一步都與模型進行往返通訊。

該儲存庫包含兩個不同的實作:

  • JavaScript/Playwright: 使用 Playwright 定位器與截圖來控制網頁瀏覽器。
  • Python/PyAutoGUI: 透過截圖、滑鼠輸入與鍵盤輸入來控制桌面環境。

Who it’s for

尋求實作代理式工作流(agentic workflows)的開發者,即 AI 需要控制瀏覽器或桌面作業系統以執行任務的情境。

Highlights

  • Dual-Runtime Support: 包含基於瀏覽器的(Playwright)與基於桌面的(PyAutoGUI)代理。
  • Persistent State: 使用一個在模型呼叫之間保持狀態可用的運行時,以降低延遲與上下文使用量。
  • Scenario Labs: 包含一組實驗室模板(Kanban board、drawing canvas、hotel booking)以測試與提示代理。
  • Traceability: 提供一個網頁控制台來檢查記錄的追蹤紀錄與截圖時間軸,以檢視代理行為。

相關

  • 專案
  • 專案
  • 專案
  • 專案