xlang-ai/OSWorld-V2

OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks

解决的问题

OSWorld-V2 提供了一个标准化的基准和环境,用于评估具备「计算机使用」能力的 AI 代理。它解决了在需要与完整操作系统(包括浏览器、应用程序和文件系统)交互的长期、现实世界任务上测试代理的困难,同时通过限制任务定义和资源的访问来防止基准泄露。

工作原理

该项目通过 Docker 或 AWS 创建一个受控的虚拟机(VM)环境,使代理能够执行操作。它使用一组托管在 Hugging Face 上的受保护 Python 任务类和资源来定义目标并评估成功。为确保真实性和稳定性,系统采用模拟网站和自托管的 GitLab 实例来处理特定任务。该系统支持多环境并行执行,并提供工具用于手动检查任务和记录轨迹。

适用对象

专为 AI 研究人员和开发者设计,他们正在构建能够通过截图感知屏幕内容,并与计算机界面交互以完成复杂多步骤工作流的多模态代理。

主要亮点

  • 真实世界模拟:在实际操作系统环境中测试代理,而非简化 API。
  • 防止泄露:任务类和资源通过受保护的 Hugging Face 数据集分发,防止代理在训练数据中找到答案。
  • 灵活的基础设施:支持本地 Docker 部署和可扩展的 AWS 并行评估。
  • 全面的工具集:包含轨迹查看器、手动检查脚本以及从 OSWorld 1.0 迁移代理的迁移工具。

相关

  • 项目
  • 项目
  • 项目
  • 项目