openai/openai-cua-sample-app
Learn how to use CUA (our Computer Using Agent) via the API on multiple computer environments.
What it solves
這項專案提供了構建「電腦使用代理」(computer-use agents)的參考實作,這些是能透過檢查螢幕、選擇動作並驗證結果來操作軟體介面以完成任務的 AI 系統。
How it works
該系統使用一個迴圈,由模型編寫程式碼來與軟ware 互動。一個持久性運行時(persistent runtime)在呼叫之間維護狀態與輔助函數,讓模型可以組合多個動作並處理觀察結果,而不需要在每一步都與模型進行往返通訊。
該儲存庫包含兩個不同的實作:
- JavaScript/Playwright: 使用 Playwright 定位器與截圖來控制網頁瀏覽器。
- Python/PyAutoGUI: 透過截圖、滑鼠輸入與鍵盤輸入來控制桌面環境。
Who it’s for
尋求實作代理式工作流(agentic workflows)的開發者,即 AI 需要控制瀏覽器或桌面作業系統以執行任務的情境。
Highlights
- Dual-Runtime Support: 包含基於瀏覽器的(Playwright)與基於桌面的(PyAutoGUI)代理。
- Persistent State: 使用一個在模型呼叫之間保持狀態可用的運行時,以降低延遲與上下文使用量。
- Scenario Labs: 包含一組實驗室模板(Kanban board、drawing canvas、hotel booking)以測試與提示代理。
- Traceability: 提供一個網頁控制台來檢查記錄的追蹤紀錄與截圖時間軸,以檢視代理行為。
相關
- 專案
- 專案
- 專案
- 專案