Stanford CS329A 关于智能体评估与长程任务的讲座

METR 时间跨度评估

METR 基准测试通过报告在 50% 和 80% 成功率下的时间跨度(并根据人类专业人员进行校准)来衡量模型能够可靠完成任务的时长。

  • 对于短任务(1–30 秒),成功率很高;对于 HCAST 任务(1 分钟–30 小时),成功率差异很大;对于 RE‑Bench 任务(长达 8 小时),成功率较低。
  • 50% 时间跨度已从 GPT‑2 (2019) 的约 2 秒增长到 Claude 3.7 Sonnet (2025) 的约 59 分钟,大约每七个月翻一倍。
  • 在 80% 可靠性下,时间跨度要短得多:Claude 3.7 Sonnet 达到约 15 分钟,显示出 50% 和 80% 性能之间存在巨大差距。
  • 改进是由更好的逻辑推理、代码生成、工具使用、错误恢复和上下文工程驱动的,但可靠性仍然是一个限制因素。

GDPVal 经济价值基准

GDPVal 评估模型输出是否足以媲美拥有十年以上经验的行业专业人员,并报告了 44 种职业和 9 个领域的胜率。

  • 胜率从 GPT‑4o 的 12.4% 上升到 Claude Opus 4.1 的 47.6%,表明在过去两年中呈现出大致线性的增长。
  • 任务定义明确,通常是多模态的,且在黄金子集中,每个任务的平均价值约为 $400。
  • 模型在短促、定义明确的任务上表现更好,而在较长、模糊的任务上表现下降;当它们必须在没有明确上下文的情况下推断工作内容时,它们会感到困难。
  • 提供上下文和任务框架的人类监督使 AI 辅助在许多职业中具有成本效益。

DeepScholar‑Bench 研究综述生成测试

DeepScholar‑Bench 测试模型是否可以为学术论文生成文献综述章节,并对知识综合、检索质量和引用可验证性进行评分。

  • 当前系统(OpenAI deep research, Gemini deep research 等)在此项实时基准测试中的总分低于 19%。
  • 模型通常能生成连贯的英文,但会遗漏关键事实;检索质量中等,文档重要性得分低于 12.5%。
  • 可验证性可能很高(例如,DeepScholar base 约 90% 准确率),但综合能力和可验证性很少能同时达到卓越。
  • 失败模式源于不完整的源文档检索、无法评估文档重要性、关键事实提取效率低下以及综合质量与引用准确性之间的权衡。

失败模式与挑战

在所有基准测试中,反复出现的智能体失败模式包括:

  • 规划能力差:无法将任务分解为适当的步骤。
  • 工具选择错误:选择无法推进任务的工具。
  • 过早放弃:由于重复行为或困惑而导致在成功前停止。
  • 重复性动作循环:在失败后反复执行同一个高概率动作。
  • 其他挑战:模型需要大量的上下文来了解工作内容,难以处理模糊的提示词,并且在软件和知识工作领域之外表现出有限的泛化能力。

核心结论

  • 能力(时间跨度)正在呈指数级增长,但可靠性(80% 时间跨度)显著滞后。
  • 经济价值基准显示了线性增长,并强调了明确的上下文和“人机协作”框架的重要性。
  • 研究综述任务揭示了模型仍然无法同时匹配专家级的知识检索、关键事实提取和引用验证。
  • 因此,智能体 AI 的进步需要更好的规划、工具使用、错误恢复以及为长程目标提供或推断必要上下文的方法。

Sources