YYHDBL/shopping-grpo-longhorizon
面向长程购物 Agent 的可复现后训练
何を解決するか
このプロジェクトは、長期的なショッピングエージェントのための再現可能なポストトレーニングおよび評価パイプラインを提供します。これは、指示の理解、ツールの使用、長いコンテキストの管理、および制約事項(予算、ブランド、特定の製品仕様など)の充足が必要となる、複雑で多段階のショッピングタスクを処理するためのLLMのトレーニングにおける課題に対処します。
仕組み
このプロジェクトは、以下の3つの主要なステージで構成される継続的なポストトレーニングパイプラインを実装しています:
- SFT (Supervised Fine-Tuning): モデルは、ShopSimulator環境内で教師モデル (DeepSeek-V4-Flash) によって収集された高品質な軌跡から、正当かつ完全なショッピング行動を学習します。
- GRPO (Group Relative Policy Optimization):
veRLフレームワークを使用し、ShopSimulator環境内でのオンラインロールアウトを通じてモデルをさらに最適化します。これは、トレーニングに外部のLLM-as-a-Judgeを必要とせずに、最終的な購入結果と制約事項の充足を評価する決定論的な「Reward v3」システムによってガイドされます。 - Evaluation: モデルは「Final-200 Clean」ベンチマークでテストされます。評価には、ハードコードされたチェックと2つの特化されたLLMジャッジ(ルーブリック作成用のDeepSeek V4 Flashと、軌跡判定用のDeepSeek V4 Pro)を組み合わせて使用し、検索戦略、意思決定の質、および効率性に関する多角的なスコアを提供します。
対象者
LLMエージェント、人間/環境からのフィードバックによる強化学習、およびeコマース環境における長期的なタスクプランニングに取り組んでいる研究者や開発者。
ハイライト
- 統合された環境: ShopSimulator v2.1環境と製品データをリポジトリに直接含んでいます。
- 決定論的な報酬システム: トレーニング中の主観的なジャッジのバイアスを避けるため、カテゴリ、予算、ブランド、および仕様に対して重み付けされた報酬システム (Reward v3) を使用しています。
- 多段階パイプライン: 教師の軌跡収集 $\rightarrow$ LoRA SFT $\rightarrow$ オンライン GRPO $\rightarrow$ 監査された評価、という明確な経路を提供します。
- 包括的な評価: スコアリング中の回答漏洩を防ぐため、ジャッジを正解から分離する厳格な評価パイプライン。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト