langfengQ/verl-agent
verl-agent is an extension of veRL, designed for training LLM/VLM agents via RL. verl-agent is also the official code for paper "Group-in-Group Policy Optimization for LLM Agent Training"
What it solves
verl-agent 解決了訓練 LLM 代理人在長時程任務上的可擴展性問題。傳統方法常將整個互動歷史串接起來,導致上下文長度快速增長,進而觸發 token 限制或效率低下。此專案提供一套透過強化學習 (RL) 訓練代理人的框架,能在多回合互動中避免上下文長度線性增長。
How it works
此框架實作了 step-independent multi-turn rollout mechanism。它不會把所有先前回合全部附加,而是允許完全自訂每一步的輸入結構與歷史管理。這意味著開發者可以精確定義在每一步傳遞給模型的資訊(例如最近的步驟、摘要或關鍵事件),使上下文長度幾乎保持不變。
它與 veRL 函式庫整合,支援多種 RL 演算法(包括本專案自行實作的 GiGPO)以及平行化的 Gym 風格環境,以實現高通量訓練。亦同時支援純文字與視覺語言兩種模態。
Who it’s for
此工具設計給 AI 研究者與開發者,用於在各種環境中構建推理代理人,任務可能涵蓋具身 AI(ALFWorld)、數位介面(WebShop、AppWorld)、視覺遊戲(Sokoban)以及工具呼叫搜尋任務等複雜多步驟情境。
Highlights
- Customizable Memory:彈性記憶模組讓開發者能精確選擇每一步要納入的歷史資訊。
- Long-Horizon Scalability:隨時間保持恆定的上下文長度,支援 30–50 步的長時程任務。
- Broad Algorithm Support:內含 GiGPO、GRPO、PPO、DAPO、GSPO、RLOO 與 REINFORCE++ 等實作。
- Multi-Modal Capability:支援訓練視覺語言代理人(例如使用 Qwen3-VL)以處理需要視覺感知的任務。
- Efficient Training:支援 LoRA 微調以降低計算成本,讓 7B 模型可在兩張 H100 GPU 上完成訓練。