Ecom-RLVE: 自适应可验证环境用于电子商务对话代理

Ecom-RLVE: 适用于电子商务对话代理的自适应可验证环境

Hugging Face 已宣布 Ecom-RLVE,这是一个旨在提高电子商务对话代理任务完成率的框架。通过将 RLVE(可验证环境的强化学习)框架扩展到多回合、工具增强的对话中,EcomRLVE-GYM 提供了一组可验证的环境,其中代理被优化以实现实际结果——例如正确的产品选择和购物车准确性——而不仅仅是对话流畅性。

可验证奖励 vs. LLM-as-a-Judge

Ecom-RLVE 解决了大型语言模型(LLMs)在对话中流畅但无法完成复杂交易任务之间的差距。为了解决这个问题,该框架使用了带有可验证奖励的强化学习(RLVR),通过算法验证移除了“LLM-as-a-judge”的主观性。 每个结果都由一个能够访问真实目标的程序进行评估。奖励信号由三个主要部分组成:

  • 任务奖励: 衡量代理是否成功完成目标(例如,正确推荐产品或购物车准确性)。
  • 效率奖励: 惩罚由代理错误导致的无效轮次,而忽略由用户跟进导致的轮次。
  • 幻觉惩罚: 惩罚代理推荐在会话期间未实际检索到的产品 ID。 无效输出,例如格式错误的 JSON 或非法工具调用,将导致立即失败得分,以激励格式正确的响应。

EcomRLVE-GYM 的八个环境

EcomRLVE-GYM 由八个不同的环境组成,这些环境模拟真实世界的购物场景。每个环境都要求代理使用工具——例如目录搜索、购物车操作和订单查询——来满足用户请求。

环境 代理目标
产品发现 查找满足所有用户约束的产品
替代 为缺货商品寻找兼容的替代品
购物车构建 将精确的产品、变体和数量添加到购物车
退货 + 替换 识别正确的订单行,启动退货,并建议替换
订单追踪 解决预期的订单并报告其状态
政策问答 回答关于商店政策的确定性问题
捆绑规划 在预算内推荐完整的购物清单
多意图旅程 在单个序列中链接上述 2–5 项任务

自适应难度课程

为了防止训练饱和或不足,Ecom-RLVE 采用了一种自适应难度课程。单个难度值 (d) 控制着 12 个任务复杂度的独立轴。

  • 约束数量: 用户约束的数量从 d=0 时的 2 增加到 d=12 时的 8。
  • 约束遗漏: 用户遗漏约束的频率从 5% 增加到 ~80%,迫使代理提出澄清问题。
  • 干扰比例: 搜索结果中干扰项的比例从 0% 增加到 24%。
  • 库存波动: 中途对话中商品缺货的频率从 0% 增加到 50%。 每个环境独立跟踪代理的成功率,仅在代理可靠地通过当前级别时才提升难度。

深入探讨:购物车构建 (E_CART)

购物车构建环境凸显了 变体选择 的必要性。由于真实目录稀疏,该框架在情节初始化时合成变体(例如,电子产品的连接器类型、服装的尺寸)。 要在 E_CART 中取得成功,代理必须掌握五项技能:产品发现、变体选择、购物车管理、澄清对话以及处理多项订单。它使用六种工具,包括 catalog_searchcatalog_get_variantscart_addcart_viewuser_get_visit_historyask_user

用户模拟与缩放

Ecom-RLVE 使用 Qwen3.5 (9.7B) 作为用户模拟器,以生成自然且多样的消息,包括拼写错误和主题切换。模拟器确保用户偏好与声明的约束匹配,并战略性地省略信息以迫使代理进行澄清。 环境缩放遵循嵌套结构(C1 ⊂ C2 ⊂ C4 ⊂ C8),其中在完整套件 (C8) 上训练的代理被假设为优于仅在单一环境上训练的专家。

早期训练结果

在一项可行性研究中,Qwen 3 8B 模型在购物车构建 (C1) 环境上使用 DAPO 进行了 300 步的训练。结果表明达到的难度水平呈现逐步增长,证实自适应调度为代理任务完成提供了稳定的学习信号。

Sources