OpenAI Operator 系统卡

OpenAI 已宣布 Operator,这是其 Computer-Using Agent (CUA) 模型的研究预览版。Operator 将 GPT-4o 的视觉能力与强化学习相结合,通过光标和键盘来解读截图并与图形用户界面 (GUI) 进行交互,从而在用户监督下执行日常的基于浏览器的任务,例如预订或订购杂货。

技术架构与训练

Operator 的设计旨在像人类一样感知和与计算机屏幕进行交互。其开发依赖于两种主要的训练方法:

  • Supervised Learning: 用于建立基础感知和输入控制,使模型能够读取屏幕并准确点击 UI 元素。
  • Reinforcement Learning: 用于开发更高级的能力,包括复杂推理、错误纠正以及对意外事件的适应。

训练数据包括公开可用的机器学习数据集、网络爬取数据以及由人类训练师开发的专门数据集,这些数据集展示了在计算机上完成任务的过程。

安全框架与风险识别

OpenAI 采用多层安全方法来应对三个主要风险向量:使用不当的用户(有害任务)、使用不当的模型(错误)以及使用不当的网站(提示注入)。

前沿风险评估

在 OpenAI 的准备框架下评估,Operator 的风险水平如下:

  • CBRN (化学、生物、放射性和核): 低。在生物风险工具评估中,Operator 的成功率为 1%,在 OCR 和长 DNA 序列方面表现不佳。
  • Cybersecurity: 低(继承自 GPT-4o)。
  • Persuasion: 中等(继承自 GPT-4o)。
  • Model Autonomy: 低。在自主复制测试中,由于其仅视觉输入模式,模型在代码编辑和终端任务上遇到困难,所有主要任务的得分均低于 10%。

减轻有害任务

Operator 已经过训练以拒绝有害任务,在内部评估集上对代理型伤害(如非法活动或被禁止的金融交易)的拒绝率达到 97%。系统级限制阻止模型导航至便于禁止活动的网站。具体禁止用途包括:

  • 促进非法活动或危及隐私。
  • 欺诈、诈骗或冒充他人。
  • 自动化高后果受监管的活动,例如股票交易。
  • 创建用于骚扰或诽谤他人的内容。

应对模型错误

为了防止不可逆的错误(例如,将电子邮件发送给错误的收件人),OpenAI 实施了若干防护措施:

  • Confirmations: 模型被设计为在最终执行会改变世界状态的操作之前询问用户确认。该机制在 20 种高风险操作类别中达到了 92% 的召回率。
  • Proactive Refusals: 高风险任务(如银行交易)会被主动拒绝,召回率为 94%。
  • Watch Mode: 对于敏感站点(例如电子邮件服务),如果用户变得不活跃或离开页面,Operator 会自动暂停执行。

防御提示注入

提示注入发生在模型遵循第三方网站上发现的恶意指令时。OpenAI 通过模型级鲁棒性将易受攻击性从未缓解的 62% 降低至 23%。此外,实施了专用的 prompt injection monitor,在检测和在疑似攻击期间暂停执行方面实现了 99% 的召回率和 90% 的精确率。

API 可用性与开发者指导

截至 2025 年 3 月 11 日,CUA 模型对选定的开发者(Tiers 3-5)以 computer-use-preview 的形式提供。OpenAI 指出,该模型在非浏览器环境中的可靠性目前较低,在 OSWorld 上的成功率为 38.1%。

为了缓解 API 特定的风险——例如通过系统消息修改导致的大规模滥用或越狱潜力增加——OpenAI 提供:

  • Containerized Starter Setup: 一个 Docker 应用程序,以鼓励使用隔离环境。
  • Safety Checks: 将提示注入和敏感域检查集成到 API 中。
  • Enhanced Monitoring: 扩大对可疑使用模式和政策违规的检测。

当前局限性

Operator 仍处于早期阶段,在短期、可重复的任务上表现最佳。它目前在日历和幻灯片等复杂环境中面临挑战。由于对抗鲁棒性仍是一个开放的研究问题,OpenAI 继续基于其有限研究预览推出的真实世界观察来迭代安全措施。

Sources