alphadl/AdaRubrics
AdaRubric: Adaptive Dynamic Rubric Evaluator for Agent Trajectories
何を解決するか
AdaRubricは、LLMエージェントの評価において、固定された評価基準(例:「役立つ」や「安全」)が失敗することを解決します。異なるエージェントタスクには異なる成功基準が必要であり、たとえばコードデバッグでは「正しさ」、ウェブナビゲーションでは「行動効率」が求められるため、万能の基準は品質を誤って測定する傾向があります。AdaRubricは、タスク固有の評価基準と密集した報酬信号を生成することで、エージェントの軌道をより正確に評価できます。
動作方法
本プロジェクトは3段階のパイプラインを実装しています:
- 評価基準生成機: LLMを使用して、特定のタスク説明に基づき、直交する評価次元と5段階のスコアリング基準のセットを生成します。
- 軌道評価機: エージェントの各ステップ(Thought $\rightarrow$ Action $\rightarrow$ Observation)を、生成されたすべての次元でスコア付けし、スコアと信頼度重みを割り当てます。
- データフィルタ: 高品質なデータをトレーニング用に選別するためのさまざまな戦略を用います。特に
DimensionAwareFilterは、1つの重要な次元での深刻な失敗が平均スコアの高さに隠されてしまうのを防ぎます。
対象ユーザー
LLMエージェントのトレーニングに取り組む研究者や開発者向けです。報酬学習(例:DPOやPPO)に必要な信頼性の高い評価指標と高品質な好みペアが必要な方々に最適です。
主な特徴
- タスク適応型: 固定されたベンチマークに頼らず、リアルタイムでカスタム評価基準を生成します。
- 密集したフィードバック: 最終的な単一の成績ではなく、ステップごと・次元ごとのスコアを提供します。
- 柔軟な集約: タスクの重要度に応じて、重み付き平均、幾何平均、最小スコアの集約方式をサポートします。
- 実証された効果: WebArena、ToolBench、AgentBenchにおいてDPOタスクの成功確率が向上し、人間の判断との相関性も向上していることが実証されています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト