YYHDBL/shopping-grpo-longhorizon

面向长程购物 Agent 的可复现后训练

它解決的問題

此專案提供了一個可重現的訓練後與評估流程,適用於長時間視野的購物代理。它解決了訓練大型語言模型(LLM)處理複雜、多步驟購物任務的挑戰,這些任務需要理解指令、使用工具、管理長上下文,以及滿足各種限制條件(例如預算、品牌與特定產品規格)。

如何運作

此專案實作了一個連續的訓練後流程,包含三個主要階段:

  1. SFT(監督式微調): 模型從教師模型(DeepSeek-V4-Flash)在 ShopSimulator 環境中收集的高品質軌跡中學習合法且完整的購物行為。
  2. GRPO(群組相對策略優化): 使用 veRL 框架,模型在 ShopSimulator 環境中透過線上滾動進一步優化。其由一個確定性的「Reward v3」系統引導,該系統評估最終購買結果與限制條件的滿足情況,無需外部 LLM 作為評審進行訓練。
  3. 評估: 模型在「Final-200 Clean」基準上進行測試。評估結合硬編碼檢查與兩個專用的 LLM 評審(DeepSeek V4 Flash 用於評分標準的建立,DeepSeek V4 Pro 用於軌跡評審),以提供在搜尋策略、決策品質與效率方面的多維度分數。

適用對象

致力於 LLM 代理、人類/環境反饋的強化學習,以及電商環境中長時間視野任務規劃的研究人員與開發者。

特色亮點

  • 整合式環境: 直接在倉儲庫中包含 ShopSimulator v2.1 環境與產品資料。
  • 確定性獎勵系統: 使用加權獎勵系統(Reward v3)針對類別、預算、品牌與規格進行評估,避免訓練期間因主觀評審帶來的偏差。
  • 多階段流程: 清晰的流程路徑:教師軌跡收集 $ ightarrow$ LoRA SFT $ ightarrow$ 線上 GRPO $ ightarrow$ 审核後評估。
  • 全面的評估: 一套嚴謹的評估流程,將評審與正確答案分離,以防止評分時出現答案洩漏。

相關

  • 專案
  • 專案
  • 專案
  • 專案