langfengQ/verl-agent
verl-agent is an extension of veRL, designed for training LLM/VLM agents via RL. verl-agent is also the official code for paper "Group-in-Group Policy Optimization for LLM Agent Training"
What it solves
verl-agent 解决了训练 LLM 代理人在长时程任务上的可扩展性问题。传统方法常将整个交互历史拼接,导致上下文长度快速增长,进而触发 token 限制或效率低下。该项目提供了一套通过强化学习 (RL) 训练代理的框架,能够在多回合交互中避免上下文长度线性增长。
How it works
该框架实现了 step-independent multi-turn rollout mechanism。它不再把所有先前回合全部追加,而是允许完全自定义每一步的输入结构和历史管理。这意味着开发者可以精确定义在每一步传递给模型的信息(例如最近的步骤、摘要或关键事件),使上下文长度几乎保持不变。
它与 veRL 库集成,支持多种 RL 算法(包括项目自行实现的 GiGPO)以及并行化的 Gym 风格环境,以实现高吞吐量训练。也同时支持纯文本和视觉语言两种模态。
Who it’s for
此工具面向 AI 研究者和开发者,用于在各种环境中构建推理代理,任务可能涵盖具身 AI(ALFWorld)、数字界面(WebShop、AppWorld)、视觉游戏(Sokoban)以及工具调用搜索任务等复杂多步骤情境。
Highlights
- Customizable Memory:灵活的记忆模块让开发者能够精确选择每一步要包含的历史信息。
- Long-Horizon Scalability:随时间保持恒定的上下文长度,支持 30–50 步的长时程任务。
- Broad Algorithm Support:包含 GiGPO、GRPO、PPO、DAPO、GSPO、RLOO 与 REINFORCE++ 等实现。
- Multi-Modal Capability:支持训练视觉语言代理(例如使用 Qwen3-VL)以处理需要视觉感知的任务。
- Efficient Training:支持 LoRA 微调以降低计算成本,使 7B 模型可在两张 H100 GPU 上完成训练。