Ecom-RLVE: Eコマース会話エージェントのための適応可能な検証可能な環境

Ecom-RLVE: Eコマース会話エージェントのための適応可能な検証可能な環境

Hugging Faceは、Eコマース会話エージェントのタスク完了率を向上させるために設計されたフレームワークEcom-RLVEを発表しました。RLVE(検証可能な環境を用いた強化学習)フレームワークをマルチターン、ツール拡張会話に拡張することで、EcomRLVE-GYMは、会話の流暢さだけではなく、正しい製品選択やカートの正確性などの実際の成果に最適化される検証可能な環境のセットを提供します。

Verifiable Rewards vs. LLM-as-a-Judge

Ecom-RLVEは、大規模言語モデル(LLM)が会話では流暢だが複雑なトランザクションタスクを完了できないギャップに対処します。これを解決するため、フレームワークはアルゴリズムによる検証を用いて「LLM-as-a-judge」の主観性を排除する検証可能な報酬による強化学習(RLVR)を利用します。

すべての結果は、グランドトゥルースゴールにアクセスできるプログラムによって評価されます。報酬信号は3つの主要なコンポーネントから構成されます。

  • Task Reward: エージェントが目標を正常に完了したかどうかを測定します(例:正しい製品の推奨またはカートの正確性)。
  • Efficiency Reward: エージェントのミスによる無駄なターンをペナルティとし、ユーザーのフォローアップによるターンは無視します。
  • Hallucination Penalty: セッション中に実際に取得されなかった製品IDを推奨したエージェントにペナルティを課します。

不正な出力(例:不正なJSONまたは違法なツール呼び出し)は、よく形成されたレスポンスをインセンティブとするために即時失敗スコアとなります。

The Eight EcomRLVE-GYM Environments

EcomRLVE-GYMは、実際のショッピングシナリオをシミュレートする8つの異なる環境から構成されます。それぞれは、ユーザーのリクエストを満たすために、カタログ検索、カート操作、注文ルックアップなどのツールを使用することをエージェントに要求します。

Environment Agent Objective
Product Discovery すべてのユーザー制約を満たす製品を見つける
Substitution 在庫切れのアイテムに対する互換性のある代替品を見つける
Cart Building 正確な製品、バリアント、数量をカートに追加する
Return + Replacement 正しい注文行を特定し、返品を開始し、代替品を提案する
Order Tracking 意図された注文を解決し、その状態を報告する
Policy QA ストアポリシーについての決定論的な質問に答える
Bundle Planning 予算内での完全なショッピングリストを推奨する
Multi-Intent Journey 上記のタスクのうち2〜5つを単一のシーケンスで連鎖させる

Adaptive Difficulty Curriculum

トレーニングの飽和または飢餓を防ぐため、Ecom-RLVEは適応的難易度カリキュラムを採用します。単一の難易度値(d)がタスクの複雑さの12の独立した軸を制御します。

代表的な難易度の軸には以下が含まれます:

  • Constraint Volume: ユーザー制約の数は、d=0での2からd=12での8へ増加します。
  • Constraint Omission: ユーザーが制約を省略する頻度は5%から約80%へ増加し、エージェントに clarification 質問を強制します。
  • Distractor Ratio: 検索結果のうち気を散らす要素の割合は0%から24%へ増加します。
  • Stock Volatility: 会話中にアイテムが在庫切れになる頻度は0%から50%へ増加します。

各環境はエージェントの成功率を独立して追跡し、エージェントが現在のレベルを確実に通過したときのみ難易度を進めます。

Deep Dive: Cart Building (E_CART)

Cart Building環境は、バリアント選択の必要性を強調します。実際のカタログは疎であるため、フレームワークはエピソード初期化時にバリアント(例:電子機器のコネクタタイプ、衣類のサイズ)を合成します。

E_CARTで成功するため、エージェントは製品発見、バリアント選択、カート管理、clarification ダイアログ、マルチアイテム注文の処理という5つのスキルを習得する必要があります。また、catalog_searchcatalog_get_variantscart_addcart_viewuser_get_visit_historyask_userを含む6つのツールを使用します。

User Simulation and Scaling

Ecom-RLVEは、タイポやトピックの切り替えを含む自然で多様なメッセージを生成するユーザーシミュレータとして**Qwen3.5 (9.7B)**を使用します。シミュレータは、ユーザーの好みが述べられた制約に一致することを確保し、エージェントに clarification を強制するために戦略的に情報を省略します。

環境のスケーリングはネストされた構造(C1 ⊂ C2 ⊂ C4 ⊂ C8)に従い、フルスイート(C8)で訓練されたエージェントは、単一の環境のみで訓練されたスペシャリストを上回ると仮定されています。

Early Training Results

実行可能性の研究において、Qwen 3 8BモデルはCart Building (C1)環境で300ステップにわたってDAPOを使用して訓練されました。その結果、到達した難易度レベルの段階的な成長が示され、適応的スケジューリングがエージェンティックなタスク完了のための安定した学習信号を提供することが確認されました。

Sources