KMnO4-zx/agentic-rl-lab
Reproducing and studying RL algorithms for LLM agents, including GRPO, GSPO, DAPO, OPD, Search-R1, ReTool, ALFWorld and beyond.
解决的问题
本项目旨在简洁地复现前沿的LLM强化学习(RL)算法,降低研究Agentic-RL时的GPU和代码复杂性门槛。
工作原理
利用PyTRIO基础设施,该仓库实现了一系列实验记录和教程。每个实现都包含对算法起源、解决的问题及其核心变量的清晰解释,并附带数据、奖励、损失函数和训练循环的可运行代码,以及通过SwanLab进行的实验跟踪。
目标受众
希望在没有复杂基础设施的情况下研究和实现前沿LLM RL及Agentic-RL方法的算法工程师和研究人员。
主要特点
- 广泛的算法覆盖:复现多种方法,包括GRPO、OPD、OPSD、GSPO、DAPO、Search-R1、ReTool、ALFWorld、Vision GRPO和AgentOPSD。
- 轻量级设计:专注于使用更简单的代码和更低的硬件要求进行即时复现。
- 多样化的任务支持:包括数学推理(GSM8K)、医疗能力、多轮搜索、代码交错代理和基于视觉的几何问题(GeoQA)的实现。
- 环境集成:与TextWorld集成,用于在模拟家庭环境中训练代理。
相关
- 项目
- 项目
- 项目
- 项目