KMnO4-zx/agentic-rl-lab
Reproducing and studying RL algorithms for LLM agents, including GRPO, GSPO, DAPO, OPD, Search-R1, ReTool, ALFWorld and beyond.
解決する課題
このプロジェクトは、最先端のLLM強化学習(RL)アルゴリズムを簡潔に再現し、Agentic-RLの研究におけるGPUとコードの複雑さの壁を低くすることを目的としています。
仕組み
PyTRIOインフラストラクチャを使用して、リポジトリは一連の実験記録とチュートリアルを実装しています。各実装には、アルゴリズムの起源、解決する問題、中核となる変数の明確な説明が含まれ、データ、報酬、損失関数、トレーニングループの実行可能なコードと、SwanLabによる実験追跡が付属しています。
対象読者
複雑なインフラストラクチャを必要とせずに、最先端のLLM RLおよびAgentic-RL手法を研究・実装したいと考えているアルゴリズムエンジニアや研究者。
主な特徴
- 幅広いアルゴリズムカバレッジ: GRPO、OPD、OPSD、GSPO、DAPO、Search-R1、ReTool、ALFWorld、Vision GRPO、AgentOPSDなど、多様な手法を再現。
- 軽量設計: よりシンプルなコードと低いハードウェア要件で、その場での再現に焦点を当てています。
- 多様なタスクサポート: 数学的推論(GSM8K)、医療能力、マルチターン検索、コードインタリーブエージェント、視覚ベースの幾何学問題(GeoQA)の実装を含みます。
- 環境統合: シミュレートされた家庭環境でのエージェントトレーニングのためにTextWorldと統合。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト