rdi-berkeley/agents-last-exam

Agents' Last Exam

解决的问题

AI代理的最终考试(ALE)解决了缺乏广泛覆盖的AI代理评估基准的问题,这些基准能够衡量代理在长期、具有经济价值的真实专业任务上的表现。它超越了简单的提示,评估代理是否能够实际完成跨多个行业领域的复杂工作,并获得可验证的结果。

如何工作

ALE 提供了一个开放的评估框架,将待测系统(代理工具)与一个真实的环境(Windows 或 Linux沙箱)以及特定的专业任务配对。

关键组件包括:

  • CUA-agents:该框架评估同时具备命令行界面(CLI)和图形用户界面(GUI)能力的代理。它使用跨操作系统 CUA MCP 桥接器,将点击和输入等桌面操作作为工具暴露给代理。
  • 沙箱:任务在真实机器(虚拟机或容器)上运行,复现生产环境,包括专业软件和数据。
  • 确定性评分:每个任务都有一个隐藏的参考,由评分器在代理完成工作后,根据其输出在 0 到 1 的范围内进行评分。
  • 执行循环:系统会配置沙箱,准备输入,运行代理直至完成,准备隐藏参考,然后对结果进行评分。

适用对象

ALE 专为前沿代理系统开发者和需要评估其代理在真实操作系统环境中执行多步骤专业工作流能力的研究人员设计。

亮点

  • 广泛覆盖:基于美国联邦职业分类,涵盖 13 个行业集群中的 55 个子领域。
  • 可验证结果:使用隐藏参考和确定性评分器防止信息泄露,确保客观评分。
  • 多平台支持:支持通过 Google Cloud、AWS、Alibaba Cloud、QEMU/KVM 和 Docker 部署沙箱。
  • 完整审计:记录每次运行的统一轨迹、原始日志和产物,支持端到端回放。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目