OpenAI Operator 系统卡
OpenAI 已宣布 Operator,这是其 Computer-Using Agent (CUA) 模型的研究预览版。Operator 将 GPT-4o 的视觉能力与强化学习相结合,通过光标和键盘来解读截图并与图形用户界面 (GUI) 进行交互,从而在用户监督下执行日常的基于浏览器的任务,例如预订或订购杂货。
技术架构与训练
Operator 的设计旨在像人类一样感知和与计算机屏幕进行交互。其开发依赖于两种主要的训练方法:
- Supervised Learning: 用于建立基础感知和输入控制,使模型能够读取屏幕并准确点击 UI 元素。
- Reinforcement Learning: 用于开发更高级的能力,包括复杂推理、错误纠正以及对意外事件的适应。
训练数据包括公开可用的机器学习数据集、网络爬取数据以及由人类训练师开发的专门数据集,这些数据集展示了在计算机上完成任务的过程。
安全框架与风险识别
OpenAI 采用多层安全方法来应对三个主要风险向量:使用不当的用户(有害任务)、使用不当的模型(错误)以及使用不当的网站(提示注入)。
前沿风险评估
在 OpenAI 的准备框架下评估,Operator 的风险水平如下:
- CBRN (化学、生物、放射性和核): 低。在生物风险工具评估中,Operator 的成功率为 1%,在 OCR 和长 DNA 序列方面表现不佳。
- Cybersecurity: 低(继承自 GPT-4o)。
- Persuasion: 中等(继承自 GPT-4o)。
- Model Autonomy: 低。在自主复制测试中,由于其仅视觉输入模式,模型在代码编辑和终端任务上遇到困难,所有主要任务的得分均低于 10%。
减轻有害任务
Operator 已经过训练以拒绝有害任务,在内部评估集上对代理型伤害(如非法活动或被禁止的金融交易)的拒绝率达到 97%。系统级限制阻止模型导航至便于禁止活动的网站。具体禁止用途包括:
- 促进非法活动或危及隐私。
- 欺诈、诈骗或冒充他人。
- 自动化高后果受监管的活动,例如股票交易。
- 创建用于骚扰或诽谤他人的内容。
应对模型错误
为了防止不可逆的错误(例如,将电子邮件发送给错误的收件人),OpenAI 实施了若干防护措施:
- Confirmations: 模型被设计为在最终执行会改变世界状态的操作之前询问用户确认。该机制在 20 种高风险操作类别中达到了 92% 的召回率。
- Proactive Refusals: 高风险任务(如银行交易)会被主动拒绝,召回率为 94%。
- Watch Mode: 对于敏感站点(例如电子邮件服务),如果用户变得不活跃或离开页面,Operator 会自动暂停执行。
防御提示注入
提示注入发生在模型遵循第三方网站上发现的恶意指令时。OpenAI 通过模型级鲁棒性将易受攻击性从未缓解的 62% 降低至 23%。此外,实施了专用的 prompt injection monitor,在检测和在疑似攻击期间暂停执行方面实现了 99% 的召回率和 90% 的精确率。
API 可用性与开发者指导
截至 2025 年 3 月 11 日,CUA 模型对选定的开发者(Tiers 3-5)以 computer-use-preview 的形式提供。OpenAI 指出,该模型在非浏览器环境中的可靠性目前较低,在 OSWorld 上的成功率为 38.1%。
为了缓解 API 特定的风险——例如通过系统消息修改导致的大规模滥用或越狱潜力增加——OpenAI 提供:
- Containerized Starter Setup: 一个 Docker 应用程序,以鼓励使用隔离环境。
- Safety Checks: 将提示注入和敏感域检查集成到 API 中。
- Enhanced Monitoring: 扩大对可疑使用模式和政策违规的检测。
当前局限性
Operator 仍处于早期阶段,在短期、可重复的任务上表现最佳。它目前在日历和幻灯片等复杂环境中面临挑战。由于对抗鲁棒性仍是一个开放的研究问题,OpenAI 继续基于其有限研究预览推出的真实世界观察来迭代安全措施。
Sources
- OriginalOperator System Card