OpenAI 使用计算机的代理 (CUA) 和 Operator 研究预览
OpenAI 已推出 Operator 的研究预览,这是一个能够执行基于网络任务的代理。为该代理提供动力的是 Computer-Using Agent (CUA),这是一个结合了 GPT-4o 的视觉能力并通过强化学习进行高级推理的模型。与依赖于特定于 OS 或 Web 的 API 的传统代理不同,CUA 使用原始像素、虚拟鼠标和键盘的通用界面与图形用户界面 (GUI) 进行交互,使其能够在多样化的数字环境中运行。
技术架构与工作流程
CUA 通过感知、推理和行动的迭代循环来完成多步骤任务:
- 感知:模型接收计算机屏幕的截图,作为当前状态的可视快照。
- 推理:CUA 使用思维链推理来评估观察结果,跟踪中间步骤,并根据当前和过去的截图及动作动态调整。
- 行动:模型执行点击、滚动或输入等操作。它会自动完成大多数步骤,但对于敏感操作(如响应验证码或输入登录详情)需要用户确认。
性能基准测试
CUA 使用其通用界面在多个计算机和浏览器使用基准测试中取得了新的最先进(SOTA)结果:
| 基准测试 | 类型 | OpenAI CUA | 之前的 SOTA | 人类表现 |
|---|---|---|---|---|
| OSWorld | 计算机使用 | 38.1% | 22.0% | 72.4% |
| WebArena | 浏览器使用 | 58.1% | 36.2% | 78.2% |
| WebVoyager | 浏览器使用 | 87.0% | 56.0% | N/A |
浏览器使用分析
CUA 在 WebVoyager(87%)和 WebArena(58.1%)上实现了高成功率。虽然它在较简单的任务上表现良好,但 OpenAI 指出,为了在像 WebArena 这样更复杂的基准测试中缩小与人类表现的差距,还需要进一步改进。
计算机使用分析
在 OSWorld 基准测试中,该测试评估对完整操作系统(Ubuntu、Windows、macOS)的控制,CUA 取得了 38.1% 的成功率。OpenAI 观察到“测试时间缩放”,即随着模型被允许完成任务的步骤增加,性能会提升。
实际能力与局限
通过 Operator 研究预览,OpenAI 已识别出 CUA 的具体优势和劣势:
- 优势:CUA 在与各种 UI 组件交互以搜索和过滤结果方面高度可靠(10/10 成功率),并且可以自动化重复的简单 UI 交互(例如,在 Todoist 中创建项目和列表,或在 Spotify 中创建播放列表)。
- 劣势:CUA 在处理不熟悉的 UI 和精确的文本编辑时遇到困难。例如,在使用一个它在训练过程中未频繁遇到的 HTML 编辑器时,其成功率较低(4/10)。此外,它还需要更详细的提示和特定的暗示,以提高在复杂特定站点任务上的可靠性。
安全与风险缓解
滥用
为了防止有害或非法活动,OpenAI 采取以下措施:
- 拒绝:训练模型拒绝有害任务。
- 黑名单:预先阻止访问赌博、成人娱乐以及毒品/枪支零售商。
- 审核:针对儿童安全等优先政策领域的实时自动安全检查器和离线检测管道。
模型错误
为了防止意外伤害(例如,删除文档或错误购买),系统包括:
- 用户确认:在最终完成可能产生外部副作用的任务之前,需要用户批准。
- 任务限制:拒绝诸如银行交易之类的高风险任务。
- 监控模式:在像电子邮件这样的敏感网站上要求主动用户监督。
对抗性攻击
为了防止网站上的提示注入和网络钓鱼,CUA 采用:
- 谨慎导航:训练模型以识别并忽略提示注入。
- 监控:一个独立的模型,在检测到屏幕上有可疑内容时进行监控并暂停执行。
- 检测管道:自动化和人工审查,以快速标记可疑的访问模式。
未来展望
OpenAI 计划通过 API 提供 CUA,以便开发者构建他们自己的使用计算机的代理。目前面向美国专业用户的研究预览旨在收集真实世界的反馈,以改进能力和安全缓解措施。
Sources
- OriginalComputer-Using Agent