alphadl/AdaRubrics
AdaRubric: Adaptive Dynamic Rubric Evaluator for Agent Trajectories
解決的問題
AdaRubric 解決了在評估 LLM 代理時,靜態評估基準(如「幫助性」或「安全性」)失效的問題。由於不同代理任務需要不同的成功標準——例如程式除錯需要「正確性」,而網頁導航需要「行動效率」——因此通用的評估基準往往會導致品質誤判。AdaRubric 提供了一種生成任務特定評估標準和密集獎勵信號的方法,從而更準確地評估代理軌跡。
工作原理
本專案實作一個三階段流程:
- 評估基準生成器:使用 LLM 根據特定任務描述生成一組正交的評估維度與 5 分制評分標準。
- 軌跡評估器:對代理軌跡中的每一步(Thought $\rightarrow$ Action $\rightarrow$ Observation)在每個生成的維度上進行評分,分配分數與置信度權重。
- 資料過濾器:採用多種策略篩選高品質訓練資料。特別地,
DimensionAwareFilter能防止單一關鍵維度上的災難性失敗被高平均分所掩蓋。
適用對象
專為需要可靠評估指標與高品質偏好對(用於 DPO 或 PPO 等獎勵學習)的 LLM 代理訓練研究人員與開發者設計。
主要亮點
- 任務自適應:即時生成客製化評估標準,而非依賴靜態基準。
- 密集回饋:提供每步、每維度的評分,而非單一最終評分。
- 靈活聚合:根據任務關鍵性支援加權平均、幾何平均與最小值聚合器。
- 實證增益:在 WebArena、ToolBench 和 AgentBench 上均展現 DPO 任務成功率的提升,且與人類判斷的相關性更佳。
相關
- 專案
- 專案
- 專案
- 專案