ALTK-Evolve 一致性指南以提升代理可靠性
減少 AI 代理的一致性差距
AI 代理經常表現出「一致性差距」,即它們在一次嘗試中可以解決任務,但在下一次嘗試中卻失敗,即使輸入完全相同。為了應對這一點,Hugging Face 和 IBM Research 在 altk-evolve 工具包中引入了一致性指南和一致性分析器,這使 AppWorld 基準測試中的 ReAct 代理一致性差距從 24.4 個百分點 (pp) 減少到 12.0pp,且不犧牲平均準確度。
一致性差距:Mean@k vs. Pass^k
標準代理基準測試通常報告 Mean@k(k 次運行的平均通過率),這衡量的是一般能力,但掩蓋了可靠性。為了衡量實際的使用者體驗——即代理是否每次被問到相同問題時都能成功——研究人員提出了 Pass^k:代理在 k 次運行中全部成功的任務比例。
使用在 AppWorld test_normal 數據集上由 GPT-4.1 驅動的 ReAct 代理,研究人員發現了一個顯著的可靠性問題:
- Mean@5: 77.4% (平均成功率)
- Pass^5: 53.0% (在所有 5 次運行中成功)
- Consistency Gap: 24.4pp
這個差距表明,近四分之一的任務解決得不一致,即使在 temperature 0.0 的情況下,由於平台端的擾動和 LLM 機率分佈的特性,這個問題仍然存在。
代理「翻轉」的機制
代理的不一致性源於決策點(例如:選擇 API 或參數)處的 token 機率分佈形狀:
- 尖銳分佈 (Sharp Distributions): 大部分機率質量集中在一個 token 上,使決策具有抗噪性。
- 平坦分佈 (Flat Distributions): 機率質量分散在幾個接近持平的 token 上。微小的擾動可能會重新排列這些持平的結果,導致代理「翻轉」其決策。
由於代理的軌跡由數十個這樣的決策串聯而成,每一步翻轉的微小機率會累積成一個高機率,使得在一系列運行中,至少有一個運行會偏離並失敗。
一致性分析器與指南流程
為了穩定這些「易於翻轉」的決策點,研究人員開發了一個兩階段的診斷與修復流程:
1. 透過 Consistency Analyzer 進行檢測
Consistency Analyzer 會識別單個記錄軌跡中的不穩定步驟。它會透過在給定現有上下文的條件下,針對該特定步驟請求 k 次補全(預設 k=5)來重演每個決策步驟。這種黑箱方法不需要地面真值 (ground truth)、不需要 logits,也不需要對任務進行端到端的重新運行,因此非常適合用於生產環境的流量。
2. 生成針對性的指南
被標記為不一致的步驟會使用 ALTK-Evolve 框架轉換為一致性指南。這些指南並非特定任務的瑣碎知識,而是具備通用性的規則。例如,如果一個代理在計算筆記中的標記時表現不一致,系統可能會生成一條指南:「使用以行作為錨點的 regex match 而非僅僅使用純字串計數。」
性能結果與泛化能力
在 AppWorld test_normal 上使用 GPT-4.1 的評估顯示,一致性指南顯著提升了所有難度等級的一致性:
- Aggregate Pass^5: 從 53.0% 增加到 69.0% (+16.0pp)。
- Aggregate Mean@5: 從 77.4% 增加到 81.0% (+3.6pp)。
- Consistency Gap: 從 24.4pp 縮小至 12.0pp。
難度影響
- Medium Tasks: 在 Pass^5 上看到了最高的絕對增益 (+22.9pp)。
- Hard Tasks: 在 Pass^5 上看到了 45% 的相對增益 (+14.3pp)。
- Easy Tasks: 獲得了 +12.2pp。
泛化能力
一致性指南可以泛化到其挖掘出的特定軌跡之外。當應用於同一場景中不同但相關的任務時,Pass^5 增加了 13.0pp。使用較弱的模型 (gpt-oss-120b) 進行測試顯示,類似任務的泛化增益為 +8.7pp,這表明指南可以捕捉可重複使用的失敗模式,而非僅僅是記憶特定的軌跡。
對代理開發者的實施建議
對於在生產環境中部署代理的人員,研究人員建議以下幾項關鍵實踐:
- 同時報告 Pass^k 與 Mean@k 以區分可靠的代理與僅僅是運氣好的代理。
- 監控最困難的任務,因為一致性差距通常會隨著任務難度增加而擴生。
- 優先考慮穩定性而非模型大小,因為一致性與能力是正交的;較大的模型可能會增加平均準確度,但未必能減少一致性差距。
- 利用離線診斷,因為 Consistency Analyzer 可以僅使用現有的軌跡與少數幾次針對性的 LLM 呼叫來識別風險,而不需要重新運行整個環境的實時重演。