Ecom-RLVE: 電子商務對話代理的適應性可驗證環境

Ecom-RLVE: 電子商務對話代理的適應性可驗證環境

Hugging Face 已宣布 Ecom-RLVE,這是一個旨在提升電子商務對話代理任務完成率的框架。透過將 RLVE(帶有可驗證環境的強化學習)框架擴展到多輪、工具增強的對話中,EcomRLVE-GYM 提供了一組可驗證的環境,其中代理會針對實際結果進行優化——例如正確的產品選擇和購物車準確性——而不僅僅是對話流暢性。

可驗證獎勵 vs. LLM-as-a-Judge

Ecom-RLVE 解決了大型語言模型(LLMs)在對話中流暢但無法完成複雜交易任務的差距。為了解決此問題,該框架使用了帶有可驗證獎勵的強化學習(RLVR),透過演算法驗證來移除「LLM-as-a-judge」的主觀性。

每個結果都會由一個能存取 ground-truth 目標的程式進行評估。獎勵信號由三個主要部分組成:

  • 任務獎勵: 衡量代理是否成功完成目標(例如,正確的產品推薦或購物車準確性)。
  • 效率獎勵: 懲罰由代理錯誤造成的浪費輪次,同時忽略由使用者後續提問造成的輪次。
  • 幻覺懲罰: 懲罰代理推薦在會話期間未實際檢索到的產品 ID。

無效輸出,例如格式錯誤的 JSON 或非法的工具調用,將導致立即失敗分數,以激勵格式正確的回應。

八個 EcomRLVE-GYM 環境

EcomRLVE-GYM 由八個不同的環境組成,模擬真實世界的購物場景。每個環境都要求代理使用工具——例如目錄搜尋、購物車操作和訂單查詢——來滿足使用者請求。

環境 代理目標
產品探索 尋找符合所有使用者限制的產品
替代 為缺貨商品尋找相容的替代品
購物車建構 將精確的產品、變體和數量加入購物車
退貨 + 替換 識別正確的訂單行,發起退貨,並建議替換
訂單追蹤 解決預定的訂單並報告其狀態
政策問答 回答關於商店政策的確定性問題
套裝規劃 在預算內推薦完整的購物清單
多意圖旅程 在單一序列中鏈結上述 2–5 項任務

自適應難度課程

為防止訓練飽和或飢餓,Ecom-RLVE 採用自適應難度課程。單一難度值 (d) 控制著 12 個獨立的任務複雜度軸。

代表性難度軸包括:

  • 限制數量: 使用者限制的數量從 2(在 d=0)增加到 8(在 d=12)。
  • 限制遺漏: 使用者遺漏限制的頻率從 5% 增加到 ~80%,迫使代理提出澄清問題。
  • 干擾比例: 搜尋結果中干擾項目的比例從 0% 增加到 24%。
  • 庫存波動: 中途對話中商品缺貨的頻率從 0% 增加到 50%。

每個環境會獨立追蹤代理的成功率,僅在代理可靠地通過當前關卡時才提升難度。

深入探討:購物車建構 (E_CART)

購物車建構環境凸顯了 變體選擇 的必要性。由於真實目錄稀疏,該框架會在情節初始化時合成變體(例如,電子產品的連接器類型、服裝的尺寸)。

要在 E_CART 中成功,代理必須掌握五項技能:產品探索、變體選擇、購物車管理、澄清對話以及處理多項目訂單。它使用六種工具,包括 catalog_searchcatalog_get_variantscart_addcart_viewuser_get_visit_historyask_user

使用者模擬與擴展

Ecom-RLVE 使用 Qwen3.5 (9.7B) 作為使用者模擬器,以生成自然且多樣的訊息,包括錯字和主題切換。模擬器確保使用者偏好符合已陳述的限制,並策略性地省略資訊以迫使代理進行澄清。

環境擴展遵循巢狀結構(C1 ⊂ C2 ⊂ C4 ⊂ C8),其中在完整套件 (C8) 上訓練的代理被 hypothesised 為優於僅在單一環境上訓練的專家。

早期訓練結果

在可行性研究中,Qwen 3 8B 模型在 Cart Building (C1) 環境上使用 DAPO 進行了 300 步的訓練。結果顯示達到的難度級別呈現逐步增長,證實自適應排程為代理任務完成提供了穩定的學習訊號。

Sources