Anthropic:解密 AI 代理的評估方法

精要摘要

Anthropic 發布了一份詳細指南,介紹如何建立嚴謹的 AI 代理評估("evals"),以避免反覆的調試循環並加速開發進程。核心要點是,有效的代理評估需要結合確定性、基於模型和人工評分,區分能力評估與回歸測試套件,並堅持閱讀執行記錄,確保評分者衡量的是實際表現,而非懲罰創造力。

代理評估的架構

評估 AI 代理比評估單次 LLM 回應複雜得多,因為代理會進行多輪互動、修改環境狀態,並可能找到創新的解決方案,這些方案可能繞過靜態的評分邏輯。

關鍵評估定義

為建立一致的評估系統,Anthropic 定義了以下元件:

  • 任務(問題/測試案例): 具有明確定義輸入與成功標準的單一測試。
  • 試驗: 執行任務的單次嘗試;進行多輪試驗以應對模型的非確定性。
  • 評分器: 透過斷言或檢查來評分表現的邏輯。
  • 執行記錄(追蹤/軌跡): 試驗的完整紀錄,包含工具呼叫、推理過程與 API 互動。
  • 結果: 環境的最終狀態(例如,資料庫記錄是否實際建立)。
  • 評估框架: 用於並行執行任務、記錄步驟並聚合結果的基礎設施。
  • 代理框架(支架): 讓模型能作為代理運作的系統(例如,Claude Code)。
  • 評估套件: 用來衡量特定能力或行為的一組任務。

不同代理類型的評估策略

不同代理架構需要量身訂做的評分技術,以確保準確性與實用性。

程式碼代理

程式碼代理最適合使用確定性評分器。由於軟體具有二元結果(運作或不運作),最佳標準是在穩定環境中將生成的程式碼執行於單元測試。

  • 基準測試: SWE-bench Verified 和 Terminal-Bench 是主要範例,成功定義為修復失敗測試而不破壞現有測試。
  • 混合方法: 雖然結果是確定性的,但執行記錄可使用 LLM 評分標準來評估程式碼品質與工具使用效率。

會話代理

會話代理需要多維度方法,因為互動品質與任務完成度同等重要。

  • 模擬: 這些評估通常使用第二個 LLM 模擬使用者角色,以壓力測試代理。
  • 評分: 成功透過結合狀態檢查(例如「票券是否已解決?」)、執行記錄限制(例如「是否在 <10 輪內完成?」)以及 LLM 評分標準來衡量語氣與同理心。

研究代理

研究代理產生開放式輸出,「正確性」取決於上下文。

  • 驗證: 評估重點在於實證性(主張是否有來源支持)、覆蓋度(是否包含關鍵事實)與來源品質。
  • 校準: 由於研究品質具有主觀性,基於 LLM 的評分標準必須經常與專家人為判斷進行校準。

電腦使用代理

這些代理透過螢幕截圖與點擊與 GUI 互動,而非 API。

  • 環境: 評估需要沙盒環境(例如 WebArena 或 OSWorld),以便檢視作業系統或瀏覽器的最終狀態。
  • 效率: 評估應追蹤代理選擇正確工具(例如 DOM 提取 vs. 螢幕截圖)的能力,以平衡延遲與 token 成本。

設計有效的評分器

Anthropic 建議採用分層評分方法,以平衡速度、成本與細膩度。

評分器類型 優勢 缺點
程式碼基礎 快速、客觀、可重現、成本低。 對有效變異脆弱;缺乏細膩度。
模型基礎 靈活、可擴展,能處理細膩與開放式任務。 非確定性;需人工校準。
人工 黃金標準;符合專家判斷。 成本高、速度慢,無法擴展。

能力評估 vs. 回歸評估

  • 能力(品質)評估: 設計用於找出代理能力的上限。起始通過率較低,以提供「需要攀登的山峰」。
  • 回歸評估: 設計用於確保既有功能不會失效。應維持接近 100% 的通過率。
  • 生命周期: 當能力評估達到高通過率後,便「畢業」進入回歸套件。

處理非確定性

由於代理行為在不同執行間會有差異,單一通過/失敗不足以判斷。Anthropic 建議使用兩種主要指標:

  1. pass@k: 代理在 k 次嘗試中至少獲得一次正確解答的機率。此指標適用於任何單次成功即為勝利的工具。
  2. pass^k: k 次試驗全部成功的機率。此指標對面向客戶的代理至關重要,因可靠性和一致性至關重要。

實施路線圖

第一階段:資料集收集

  • 小規模起步: 從 20–50 個來自真實失敗的任務開始。
  • 避免模糊: 確保兩位專家會得出相同結論。若代理在多輪試驗中 100% 失敗(pass@100 為 0%),通常表示任務規格有問題,而非模型失效。
  • 平衡資料集: 包含「負面」案例(即代理 不應 執行的動作),以防止過度觸發行為。

第二階段:框架與評分器設計

  • 隔離: 確保每次試驗從乾淨環境開始,避免共享狀態人為提高分數。
  • 結果優先於路徑: 評估代理產生的結果,而非其工具呼叫的特定順序,以避免懲罰創意但有效的解決方案。
  • 部分得分: 對具有多個元件的任務實作得分機制,以反映成功的連續性。

第三階段:長期維護

  • 執行記錄審查: 定期閱讀執行記錄,區分代理真正的錯誤與評分錯誤。
  • 飽和監控: 當評估達到 100% 通過率時,不再反映進步。團隊必須開發更困難的新評估以持續衡量進展。
  • 評估驅動開發: 在建構功能前,先定義計畫能力的評估任務,再迭代直到代理通過。

全面的效能理解

自動化評估是第一道防線,但必須是更廣泛策略的一部分:

  • 生產監控: 捕捉現實世界中的分佈偏移與未預期的失敗。
  • A/B 測試: 在大規模下驗證實際使用者結果(留存率、完成率)。
  • 使用者反饋: 揭示未預期的問題並提供現實世界的範例。
  • 人工審查: 建立對失敗模式的直覺,並校準 LLM 評分器。
  • 人工研究: 為主觀任務提供黃金標準參考。

Sources

相關