Stanford CS329A 關於代理評估與長時程任務的講座

METR 時程評估

METR 基準測試衡量模型能可靠地完成任務的時間長度,透過報告在 50% 和 80% 成功率下的時程,並根據人類專業人士進行校準。

  • 對於短任務(1–30 秒),成功率很高;對於 HCAST 任務(1 分鐘–30 小時),成功率差異很大;對於 RE‑Bench 任務(長達八小時),成功率很低。
  • 50% 時程已從 GPT‑2 (2019) 的約兩秒增長到 Claude 3.7 Sonnet (2025) 的約 59 分鐘,大約每七個月翻倍一次。
  • 在 80% 的可靠性下,時程要短得多:Claude 3.7 Sonnet 達到約 15 分鐘,顯示出 50% 與 80% 性能之間的巨大差距。
  • 進步是由於更好的邏輯推理、程式碼生成、工具使用、錯誤恢復和上下文工程所驅動的,但可靠性仍然是一個限制因素。

GDPVal 經濟價值基準測試

GDPVal 評估模型輸出是否足以與擁有超過十年經驗的行業專業人士的工作相媲美,報告了 44 種職業和九個領域的勝率。

  • 勝率從 GPT‑4o 的 12.4% 上升到 Claude Opus 4.1 的 47.6%,顯示出過去兩年大約呈線性增長。
  • 任務定義明確,通常是多模態的,且在黃金子集中的平均價值約為每個任務 400 美元。
  • 模型在短且定義明確的任務上表現較好,在較長且模糊的任務上表現下降;當它們必須在沒有明確上下文的情況下推斷工作內容時,它們會感到困難。
  • 提供上下文和任務框架的人類監督使 AI 輔助在許多職業中具有成本效益。

DeepScholar‑Bench 研究綜述生成測試

DeepScholar‑Bench 測試模型是否能為學術論文生成文獻回顧章節,對知識綜述、檢索品質和引用可驗證性進行評分。

  • 目前的系統(OpenAI deep research, Gemini deep research 等)在此項即時基準測試中的總分低於 19%。
  • 模型通常能生成連貫的英文,但會遺漏關鍵事實;檢索品質中等,文件重要性分數低於 12.5%。
  • 可驗證性可能很高(例如,DeepScholar 基礎版本約 90% 的精確度),但綜述與可驗證性很少能同時表現優異。
  • 失敗模式源於不完整的來源檢索、無法評估文件重要性、關鍵事實提取效率低下,以及綜述品質與引用準確性之間的權衡。

失敗模式與挑戰

在各項基準測試中,重複出現的代理失敗模式包括:

  • 規劃能力不足:無法將任務分解為適當的步驟。
  • 工具選擇錯誤:選擇無法推進任務的工具。
  • 過早放棄:由於重複行為或困惑而導致在成功前停止。
  • 重複動作循環:在失敗後重複執行相同的高機率動作。
  • 其他挑戰:模型需要廣泛的上下文來了解工作內容,難以處理模糊的提示詞,且在軟體和知識工作領域之外的泛化能力有限。

關鍵要點

  • 能力(時程)正在呈指數級增長,但可靠性(80% 時程)顯著落後。
  • 經濟價值基準測試顯示了線性增長,並強調了明確上下文和「人機協作」框架的重要性。
  • 研究綜述任務顯示,模型仍然無法同時在專家級的知識檢索、關鍵事實提取和引用驗證方面達到頂尖水平。
  • 因此,代理式 AI 的進步需要更好的規劃、工具使用、錯誤恢復,以及為長時程目標提供或推斷所需上下文的方法。

Sources