YYHDBL/shopping-grpo-longhorizon

面向长程购物 Agent 的可复现后训练

它解决了什么问题

该项目为长周期购物代理提供了一个可复现的训练后优化与评估流程。它解决了训练大语言模型(LLMs)处理复杂、多步骤购物任务的挑战,这些任务需要理解指令、使用工具、管理长上下文以及满足约束条件(如预算、品牌和特定产品规格)。

它如何工作

该项目实现了一个连续的训练后优化流程,包含三个主要阶段:

  1. SFT(监督微调): 模型从教师模型(DeepSeek-V4-Flash)在 ShopSimulator 环境中收集的高质量轨迹中学习合法且完整的购物行为。
  2. GRPO(组相对策略优化): 使用 veRL 框架,模型在 ShopSimulator 环境中通过在线 rollout 进一步优化。其优化过程由一个确定性的「Reward v3」系统引导,该系统评估最终购买结果和约束满足情况,无需依赖外部 LLM 作为评判者进行训练。
  3. 评估: 模型在「Final-200 Clean」基准上进行测试。评估结合了硬编码检查和两个专用的 LLM 判官(DeepSeek V4 Flash 用于评分标准制定,DeepSeek V4 Pro 用于轨迹评判),以多维度评分搜索策略、决策质量和效率。

适用人群

从事 LLM 代理、基于人类/环境反馈的强化学习以及电商场景中长周期任务规划的研究人员和开发者。

亮点

  • 集成环境: 仓库中直接包含 ShopSimulator v2.1 环境和产品数据。
  • 确定性奖励系统: 使用加权奖励系统(Reward v3)对类别、预算、品牌和规格进行评估,避免训练过程中因主观评判者带来的偏差。
  • 多阶段流程: 从教师轨迹收集 $\rightarrow$ LoRA SFT $\rightarrow$ 在线 GRPO $\rightarrow$ 审计评估,路径清晰明确。
  • 全面评估: 严格的评估流程,将判官与标准答案隔离,防止评分过程中出现答案泄露。

该流程为构建可靠、可复现的购物代理提供了坚实基础 — @handle

相关

  • 项目
  • 项目
  • 项目
  • 项目