Ecom-RLVE: 自适应可验证环境用于电子商务对话代理
Ecom-RLVE: 适用于电子商务对话代理的自适应可验证环境
Hugging Face 已宣布 Ecom-RLVE,这是一个旨在提高电子商务对话代理任务完成率的框架。通过将 RLVE(可验证环境的强化学习)框架扩展到多回合、工具增强的对话中,EcomRLVE-GYM 提供了一组可验证的环境,其中代理被优化以实现实际结果——例如正确的产品选择和购物车准确性——而不仅仅是对话流畅性。
可验证奖励 vs. LLM-as-a-Judge
Ecom-RLVE 解决了大型语言模型(LLMs)在对话中流畅但无法完成复杂交易任务之间的差距。为了解决这个问题,该框架使用了带有可验证奖励的强化学习(RLVR),通过算法验证移除了“LLM-as-a-judge”的主观性。 每个结果都由一个能够访问真实目标的程序进行评估。奖励信号由三个主要部分组成:
- 任务奖励: 衡量代理是否成功完成目标(例如,正确推荐产品或购物车准确性)。
- 效率奖励: 惩罚由代理错误导致的无效轮次,而忽略由用户跟进导致的轮次。
- 幻觉惩罚: 惩罚代理推荐在会话期间未实际检索到的产品 ID。 无效输出,例如格式错误的 JSON 或非法工具调用,将导致立即失败得分,以激励格式正确的响应。
EcomRLVE-GYM 的八个环境
EcomRLVE-GYM 由八个不同的环境组成,这些环境模拟真实世界的购物场景。每个环境都要求代理使用工具——例如目录搜索、购物车操作和订单查询——来满足用户请求。
| 环境 | 代理目标 |
|---|---|
| 产品发现 | 查找满足所有用户约束的产品 |
| 替代 | 为缺货商品寻找兼容的替代品 |
| 购物车构建 | 将精确的产品、变体和数量添加到购物车 |
| 退货 + 替换 | 识别正确的订单行,启动退货,并建议替换 |
| 订单追踪 | 解决预期的订单并报告其状态 |
| 政策问答 | 回答关于商店政策的确定性问题 |
| 捆绑规划 | 在预算内推荐完整的购物清单 |
| 多意图旅程 | 在单个序列中链接上述 2–5 项任务 |
自适应难度课程
为了防止训练饱和或不足,Ecom-RLVE 采用了一种自适应难度课程。单个难度值 (d) 控制着 12 个任务复杂度的独立轴。
- 约束数量: 用户约束的数量从
d=0时的 2 增加到d=12时的 8。 - 约束遗漏: 用户遗漏约束的频率从 5% 增加到 ~80%,迫使代理提出澄清问题。
- 干扰比例: 搜索结果中干扰项的比例从 0% 增加到 24%。
- 库存波动: 中途对话中商品缺货的频率从 0% 增加到 50%。 每个环境独立跟踪代理的成功率,仅在代理可靠地通过当前级别时才提升难度。
深入探讨:购物车构建 (E_CART)
购物车构建环境凸显了 变体选择 的必要性。由于真实目录稀疏,该框架在情节初始化时合成变体(例如,电子产品的连接器类型、服装的尺寸)。
要在 E_CART 中取得成功,代理必须掌握五项技能:产品发现、变体选择、购物车管理、澄清对话以及处理多项订单。它使用六种工具,包括 catalog_search、catalog_get_variants、cart_add、cart_view、user_get_visit_history 和 ask_user。
用户模拟与缩放
Ecom-RLVE 使用 Qwen3.5 (9.7B) 作为用户模拟器,以生成自然且多样的消息,包括拼写错误和主题切换。模拟器确保用户偏好与声明的约束匹配,并战略性地省略信息以迫使代理进行澄清。 环境缩放遵循嵌套结构(C1 ⊂ C2 ⊂ C4 ⊂ C8),其中在完整套件 (C8) 上训练的代理被假设为优于仅在单一环境上训练的专家。
早期训练结果
在一项可行性研究中,Qwen 3 8B 模型在购物车构建 (C1) 环境上使用 DAPO 进行了 300 步的训练。结果表明达到的难度水平呈现逐步增长,证实自适应调度为代理任务完成提供了稳定的学习信号。