Ecom-RLVE: 電子商務對話代理的適應性可驗證環境
Ecom-RLVE: 電子商務對話代理的適應性可驗證環境
Hugging Face 已宣布 Ecom-RLVE,這是一個旨在提升電子商務對話代理任務完成率的框架。透過將 RLVE(帶有可驗證環境的強化學習)框架擴展到多輪、工具增強的對話中,EcomRLVE-GYM 提供了一組可驗證的環境,其中代理會針對實際結果進行優化——例如正確的產品選擇和購物車準確性——而不僅僅是對話流暢性。
可驗證獎勵 vs. LLM-as-a-Judge
Ecom-RLVE 解決了大型語言模型(LLMs)在對話中流暢但無法完成複雜交易任務的差距。為了解決此問題,該框架使用了帶有可驗證獎勵的強化學習(RLVR),透過演算法驗證來移除「LLM-as-a-judge」的主觀性。
每個結果都會由一個能存取 ground-truth 目標的程式進行評估。獎勵信號由三個主要部分組成:
- 任務獎勵: 衡量代理是否成功完成目標(例如,正確的產品推薦或購物車準確性)。
- 效率獎勵: 懲罰由代理錯誤造成的浪費輪次,同時忽略由使用者後續提問造成的輪次。
- 幻覺懲罰: 懲罰代理推薦在會話期間未實際檢索到的產品 ID。
無效輸出,例如格式錯誤的 JSON 或非法的工具調用,將導致立即失敗分數,以激勵格式正確的回應。
八個 EcomRLVE-GYM 環境
EcomRLVE-GYM 由八個不同的環境組成,模擬真實世界的購物場景。每個環境都要求代理使用工具——例如目錄搜尋、購物車操作和訂單查詢——來滿足使用者請求。
| 環境 | 代理目標 |
|---|---|
| 產品探索 | 尋找符合所有使用者限制的產品 |
| 替代 | 為缺貨商品尋找相容的替代品 |
| 購物車建構 | 將精確的產品、變體和數量加入購物車 |
| 退貨 + 替換 | 識別正確的訂單行,發起退貨,並建議替換 |
| 訂單追蹤 | 解決預定的訂單並報告其狀態 |
| 政策問答 | 回答關於商店政策的確定性問題 |
| 套裝規劃 | 在預算內推薦完整的購物清單 |
| 多意圖旅程 | 在單一序列中鏈結上述 2–5 項任務 |
自適應難度課程
為防止訓練飽和或飢餓,Ecom-RLVE 採用自適應難度課程。單一難度值 (d) 控制著 12 個獨立的任務複雜度軸。
代表性難度軸包括:
- 限制數量: 使用者限制的數量從 2(在
d=0)增加到 8(在d=12)。 - 限制遺漏: 使用者遺漏限制的頻率從 5% 增加到 ~80%,迫使代理提出澄清問題。
- 干擾比例: 搜尋結果中干擾項目的比例從 0% 增加到 24%。
- 庫存波動: 中途對話中商品缺貨的頻率從 0% 增加到 50%。
每個環境會獨立追蹤代理的成功率,僅在代理可靠地通過當前關卡時才提升難度。
深入探討:購物車建構 (E_CART)
購物車建構環境凸顯了 變體選擇 的必要性。由於真實目錄稀疏,該框架會在情節初始化時合成變體(例如,電子產品的連接器類型、服裝的尺寸)。
要在 E_CART 中成功,代理必須掌握五項技能:產品探索、變體選擇、購物車管理、澄清對話以及處理多項目訂單。它使用六種工具,包括 catalog_search、catalog_get_variants、cart_add、cart_view、user_get_visit_history 和 ask_user。
使用者模擬與擴展
Ecom-RLVE 使用 Qwen3.5 (9.7B) 作為使用者模擬器,以生成自然且多樣的訊息,包括錯字和主題切換。模擬器確保使用者偏好符合已陳述的限制,並策略性地省略資訊以迫使代理進行澄清。
環境擴展遵循巢狀結構(C1 ⊂ C2 ⊂ C4 ⊂ C8),其中在完整套件 (C8) 上訓練的代理被 hypothesised 為優於僅在單一環境上訓練的專家。
早期訓練結果
在可行性研究中,Qwen 3 8B 模型在 Cart Building (C1) 環境上使用 DAPO 進行了 300 步的訓練。結果顯示達到的難度級別呈現逐步增長,證實自適應排程為代理任務完成提供了穩定的學習訊號。