OpenAI Operator 系統卡
OpenAI 已宣布 Operator,這是其 Computer-Using Agent (CUA) 模型的研究預覽版。Operator 結合 GPT-4o 的視覺能力與強化學習,以解讀螢幕截圖並使用游標和鍵盤與圖形使用者介面 (GUI) 互動,使其能在使用者監督下執行日常的瀏覽器相關任務,例如預訂或購買雜貨。
Technical Architecture and Training
Operator 的設計目標是像人類一樣感知並與電腦螢幕互動。其開發依賴兩種主要的訓練方法:
- Supervised Learning: 用於建立基礎層級的感知與輸入控制,使模型能讀取螢幕並準確點擊 UI 元素。
- Reinforcement Learning: 用於開發更高層級的能力,包括複雜推理、錯誤更正以及對突發事件的適應。
訓練資料包括公開的機器學習資料集、網路爬蟲以及由人類訓練者示範在電腦上完成任務所開發的專門資料集。
Safety Framework and Risk Identification
OpenAI 使用多層次安全方法來應對三種主要風險向量:使用者不對齊(有害任務)、模型不對齊(錯誤)以及網站不對齊(提示注入)。
Frontier Risk Assessment
在 OpenAI 的 Preparedness Framework 下評估,Operator 的風險等級如下:
- CBRN (化學、生物、放射性與核子): 低。在生物風險工具評估中,Operator 的成功率為 1%,在 OCR 與長 DNA 序列方面遇到困難。
- Cybersecurity: 低(繼承自 GPT-4o)。
- Persuasion: 中等(繼承自 GPT-4o)。
- Model Autonomy: 低。在自主複製測試中,由於其僅視覺輸入模式,模型在程式碼編輯與終端機任務上遇到困難,所有主要任務的得分均低於 10%。
Mitigating Harmful Tasks
Operator 已經過訓練以拒絕有害任務,在內部評估集合中對具代理性的傷害(例如非法活動或被禁止的金融交易)達成 97% 的拒絕率。系統層級限制防止模型瀏覽至協助進行被禁止活動的網站。具體被禁止的用途包括:
- 協助非法活動或危害隱私。
- 欺詐、詐騙或冒充他人。
- 自動化高後果受管制活動,例如股票交易。
- 製作用於騷擾或誹謗他人的內容。
Addressing Model Mistakes
為防止不可逆的錯誤(例如將電子郵件發送給錯誤的收件人),OpenAI 已實施數項防護措施:
- Confirmations: 模型設計為在最終執行會改變世界狀態的動作前詢問使用者確認。此機制在 20 種高風險動作類別中達成 92% 的召回率。
- Proactive Refusals: 高風險任務(例如銀行交易)會被主動拒絕,召回率為 94%。
- Watch Mode: 對於敏感網站(例如電子郵件服務),當使用者變得不活躍或離開頁面時,Operator 會自動暫停執行。
Defending Against Prompt Injections
提示注入發生時,模型會遵循第三方網站上發現的惡意指令。OpenAI 透過模型層級的穩健性將易受性從 62%(未緩解)降低至 23%。此外,專門的 prompt injection monitor 已被實施,在偵測並暫停懷疑攻擊期間的執行時達到 99% 的召回率與 90% 的精準度。
API Availability and Developer Guidance
截至 2025 年 3 月 11 日,CUA 模型可供特定開發者(Tier 3-5)使用,名稱為 computer-use-preview。OpenAI 指出,該模型在非瀏覽器環境中的可靠性目前較低,在 OSWorld 上的成功率為 38.1%。
為降低 API 特定風險——例如透過系統訊息修改導致的大規模濫用或增加越獄潛力——OpenAI 提供:
- Containerized Starter Setup: 一個鼓勵使用隔離環境的 Docker 應用程式。
- Safety Checks: 將提示注入與敏感域檢查整合到 API 中。
- Enhanced Monitoring: 擴大對可疑使用模式與政策違規的偵測。
Current Limitations
Operator 仍處於早期階段,在短暫且可重複的任務上表現最佳。目前在行事曆與投影片等複雜環境中仍面臨挑戰。由於對抗穩健性仍是開放的研究問題,OpenAI 繼續根據其有限研究預覽推出期間的真實世界觀測來迭代安全措施。
Sources
- OriginalOperator System Card