OpenAI Computer-Using Agent (CUA) 與 Operator 研究預覽

OpenAI 已推出 Operator 的研究預覽,該代理能夠執行網頁任務。該代理的核心是 Computer-Using Agent (CUA),一個結合 GPT-4o 的視覺能力並透過強化學習進行進階推理的模型。與依賴 OS- 或網頁特定 API 的傳統代理不同,CUA 使用原始像素、虛擬滑鼠和鍵盤的通用介面與圖形使用者介面 (GUI) 互動,使其能夠在多樣化的數位環境中運作。

技術架構與工作流程

CUA 透過感知、推理與行動的迭代迴圈來完成多步驟任務:

  • Perception: 模型會接收電腦螢幕的截圖,作為當前狀態的視覺快照。
  • Reasoning: CUA 使用鏈式思考推理來評估觀察結果,追蹤中間步驟,並根據當前和過去的截圖與行動動態調整。
  • Action: 模型會執行點擊、滾動或輸入等動作。它會自動完成大多數步驟,但對於敏感動作(例如回應 CAPTCHA 或輸入登入資訊)需要使用者確認。

效能基準

CUA 透過其通用介面在數個電腦與瀏覽器使用基準上創造了新的最佳狀態(SOTA)結果:

基準 類型 OpenAI CUA 先前 SOTA 人類表現
OSWorld 電腦使用 38.1% 22.0% 72.4%
WebArena 瀏覽器使用 58.1% 36.2% 78.2%
WebVoyager 瀏覽器使用 87.0% 56.0% N/A

瀏覽器使用分析

CUA 在 WebVoyager(87%)和 WebArena(58.1%)上達到了高成功率。雖然它在簡單任務上表現良好,但 OpenAI 指出,為了縮小與人類在更複雜基準(如 WebArena)上的表現差距,仍需進一步改進。

電腦使用分析

在 OSWorld 基準上(該基準評估對完整作業系統(Ubuntu、Windows、macOS)的控制),CUA 達成了 38.1% 的成功率。OpenAI 觀察到 "測試時間縮放",其中表現會隨著模型被允許執行更多步驟來完成任務而提升。

實際能力與限制

透過 Operator 研究預覽,OpenAI 已識別出 CUA 的具體優勢與劣勢:

  • Strengths: CUA 在與各種 UI 元件互動以搜尋和過濾結果方面高度可靠(10/10 成功率),並能自動化重複的簡單 UI 互動(例如在 Todoist 中建立專案和清單,或在 Spotify 中建立播放清單)。

  • Weaknesses: CUA 在不熟悉的 UI 和精確文字編輯方面表現不佳。例如,當使用一個在訓練期間很少遇到的 HTML 編輯器時,其成功率僅為 4/10。此外,它在複雜的特定網站任務上需要更詳細的提示和特定提示來提高可靠性。

安全與風險緩解

OpenAI 已實施分層安全方法來應對代理擁有直接數位存取所帶來的風險:

濫用

為防止有害或非法活動,OpenAI 採取以下措施:

  • Refusals: 訓練模型拒絕有害任務。
  • Blocklists: 預先封鎖對賭博、成人娛樂以及毒品/槍械零售商的存取。
  • Moderation: 實時自動安全檢查器和離線偵測管線,用於如兒童安全等優先政策領域。

模型錯誤

為防止意外傷害(例如刪除文件或錯誤購買),系統包含:

  • User Confirmations: 在最終完成具有外部副作用的任務前,要求使用者批准。
  • Task Limitations: 拒絕高風險任務,例如銀行交易。
  • Watch Mode: 在敏感網站(如電子郵件)上要求積極的使用者監督。

對抗性攻擊

為防禦網站上的提示注入和釣魚攻擊,CUA 使用:

  • Cautious Navigation: 訓練模型識別並忽略提示注入。
  • Monitoring: 一個獨立的模型,在偵測到螢幕上有可疑內容時監控並暫停執行。
  • Detection Pipelines: 自動與人工審閱,以快速標記可疑的存取模式。

未來展望

OpenAI 計畫透過 API 提供 CUA,讓開發者能夠構建自己的電腦使用代理。目前針對美國 Pro 用戶的研究預覽旨在收集真實世界的回饋,以改進能力和安全緩解措施。

Sources