Stanford CS329A 关于智能体评估与长程任务的讲座
METR 时间跨度评估
METR 基准测试通过报告在 50% 和 80% 成功率下的时间跨度(并根据人类专业人员进行校准)来衡量模型能够可靠完成任务的时长。
- 对于短任务(1–30 秒),成功率很高;对于 HCAST 任务(1 分钟–30 小时),成功率差异很大;对于 RE‑Bench 任务(长达 8 小时),成功率较低。
- 50% 时间跨度已从 GPT‑2 (2019) 的约 2 秒增长到 Claude 3.7 Sonnet (2025) 的约 59 分钟,大约每七个月翻一倍。
- 在 80% 可靠性下,时间跨度要短得多:Claude 3.7 Sonnet 达到约 15 分钟,显示出 50% 和 80% 性能之间存在巨大差距。
- 改进是由更好的逻辑推理、代码生成、工具使用、错误恢复和上下文工程驱动的,但可靠性仍然是一个限制因素。
GDPVal 经济价值基准
GDPVal 评估模型输出是否足以媲美拥有十年以上经验的行业专业人员,并报告了 44 种职业和 9 个领域的胜率。
- 胜率从 GPT‑4o 的 12.4% 上升到 Claude Opus 4.1 的 47.6%,表明在过去两年中呈现出大致线性的增长。
- 任务定义明确,通常是多模态的,且在黄金子集中,每个任务的平均价值约为 $400。
- 模型在短促、定义明确的任务上表现更好,而在较长、模糊的任务上表现下降;当它们必须在没有明确上下文的情况下推断工作内容时,它们会感到困难。
- 提供上下文和任务框架的人类监督使 AI 辅助在许多职业中具有成本效益。
DeepScholar‑Bench 研究综述生成测试
DeepScholar‑Bench 测试模型是否可以为学术论文生成文献综述章节,并对知识综合、检索质量和引用可验证性进行评分。
- 当前系统(OpenAI deep research, Gemini deep research 等)在此项实时基准测试中的总分低于 19%。
- 模型通常能生成连贯的英文,但会遗漏关键事实;检索质量中等,文档重要性得分低于 12.5%。
- 可验证性可能很高(例如,DeepScholar base 约 90% 准确率),但综合能力和可验证性很少能同时达到卓越。
- 失败模式源于不完整的源文档检索、无法评估文档重要性、关键事实提取效率低下以及综合质量与引用准确性之间的权衡。
失败模式与挑战
在所有基准测试中,反复出现的智能体失败模式包括:
- 规划能力差:无法将任务分解为适当的步骤。
- 工具选择错误:选择无法推进任务的工具。
- 过早放弃:由于重复行为或困惑而导致在成功前停止。
- 重复性动作循环:在失败后反复执行同一个高概率动作。
- 其他挑战:模型需要大量的上下文来了解工作内容,难以处理模糊的提示词,并且在软件和知识工作领域之外表现出有限的泛化能力。
核心结论
- 能力(时间跨度)正在呈指数级增长,但可靠性(80% 时间跨度)显著滞后。
- 经济价值基准显示了线性增长,并强调了明确的上下文和“人机协作”框架的重要性。
- 研究综述任务揭示了模型仍然无法同时匹配专家级的知识检索、关键事实提取和引用验证。
- 因此,智能体 AI 的进步需要更好的规划、工具使用、错误恢复以及为长程目标提供或推断必要上下文的方法。