YYHDBL/shopping-grpo-longhorizon

面向长程购物 Agent 的可复现后训练

무엇을 해결하는가

이 프로젝트는 장기적 쇼핑 에이전트를 위한 재현 가능한 사후 학습(post-training) 및 평가 파이프라인을 제공합니다. 이는 지시사항 이해, 도구 사용, 긴 문맥 관리, 그리고 제약 조건 충족(예: 예산, 브랜드, 특정 제품 사양)이 필요한 복잡하고 다단계적인 쇼핑 작업을 처리하도록 LLM을 학습시키는 과제를 해결합니다.

작동 방식

이 프로젝트는 세 가지 주요 단계로 구성된 연속적인 사후 학습 파이프라인을 구현합니다:

  1. SFT (Supervised Fine-Tuning): 모델은 ShopSimulator 환경 내에서 교사 모델(DeepSeek-V4-Flash)이 수집한 고품질 궤적(trajectories)으로부터 합법적이고 완전한 쇼핑 행동을 학습합니다.
  2. GRPO (Group Relative Policy Optimization): veRL 프레임워크를 사용하여, 모델은 ShopSimulator 환경에서의 온라인 롤아웃(rollouts)을 통해 추가로 최적화됩니다. 이는 훈련을 위해 외부 LLM-as-a-Judge가 필요하지 않은, 최종 구매 결과와 제약 조건 충족 여부를 평가하는 결정론적 "Reward v3" 시스템에 의해 가이드됩니다.
  3. Evaluation: 모델은 "Final-200 Clean" 벤치마크에서 테스트됩니다. 평가는 하드코딩된 체크와 두 개의 특화된 LLM 심사위원(루브릭 큐레이션을 위한 DeepSeek V4 Flash 및 궤적 판정을 위한 DeepSeek V4 Pro)을 결합하여 검색 전략, 결정 품질, 효율성에 대한 다차원적인 점수를 제공합니다.

대상 사용자

LLM 에이전트, 인간/환경 피드백으로부터의 강화 학습, 그리고 이커머스 환경에서의 장기적 작업 계획을 연구하거나 개발하는 연구자 및 개발자.

주요 특징

  • 통합 환경: ShopSimulator v2.1 환경과 제품 데이터를 저장소에 직접 포함하고 있습니다.
  • 결정론적 보상 시스템: 훈련 중 주관적인 심사위원 편향을 피하기 위해 카테고리, 예산, 브랜드 및 사양에 대해 가중치 보상 시스템(Reward v3)을 사용합니다.
  • 다단계 파이프라인: 교사 궤적 수집 $\rightarrow$ LoRA SFT $\rightarrow$ 온라인 GRPO $\to$ 감사된 평가로 이어지는 명확한 경로를 제공합니다.
  • 포괄적인 평가: 채점 과정 중 정답 유출을 방지하기 위해 심사위원을 정답(gold answers)으로부터 격리하는 엄격한 평가 파이프라인을 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트