KMnO4-zx/agentic-rl-lab

Reproducing and studying RL algorithms for LLM agents, including GRPO, GSPO, DAPO, OPD, Search-R1, ReTool, ALFWorld and beyond.

解決する課題

このプロジェクトは、最先端のLLM強化学習(RL)アルゴリズムを簡潔に再現し、Agentic-RLの研究におけるGPUとコードの複雑さの壁を低くすることを目的としています。

仕組み

PyTRIOインフラストラクチャを使用して、リポジトリは一連の実験記録とチュートリアルを実装しています。各実装には、アルゴリズムの起源、解決する問題、中核となる変数の明確な説明が含まれ、データ、報酬、損失関数、トレーニングループの実行可能なコードと、SwanLabによる実験追跡が付属しています。

対象読者

複雑なインフラストラクチャを必要とせずに、最先端のLLM RLおよびAgentic-RL手法を研究・実装したいと考えているアルゴリズムエンジニアや研究者。

主な特徴

  • 幅広いアルゴリズムカバレッジ: GRPO、OPD、OPSD、GSPO、DAPO、Search-R1、ReTool、ALFWorld、Vision GRPO、AgentOPSDなど、多様な手法を再現。
  • 軽量設計: よりシンプルなコードと低いハードウェア要件で、その場での再現に焦点を当てています。
  • 多様なタスクサポート: 数学的推論(GSM8K)、医療能力、マルチターン検索、コードインタリーブエージェント、視覚ベースの幾何学問題(GeoQA)の実装を含みます。
  • 環境統合: シミュレートされた家庭環境でのエージェントトレーニングのためにTextWorldと統合。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト