OpenManus/OpenManus-RL
A live stream development of RL tunning for LLM agents
What it solves
OpenManus-RL 提供一个框架,通过强化学习 (RL) 增强 LLM 代理人的推理与决策能力。它旨在超越简单的监督式微调,探索 RL 如何优化代理人在复杂环境中的规划、工具使用与错误恢复能力。
How it works
该项目整合 verl RL 框架以实现各种训练范式。它结合 Supervised Fine-Tuning (SFT) 作为初始化,并使用 PPO、DPO、GRPO 等 RL 算法来细化代理行为。为了提升推理,实验了 Tree-of-Thoughts (ToT)、Graph-of-Thoughts (GoT) 与 Monte Carlo Tree Search (MCTS) 等 rollout 策略。系统基于六大领域(OS、DB、Web、KG、Household、E‑commerce)的大型组合数据集,并在 GAIA、AgentBench、WebShop 等基准上进行评估。
Who it’s for
此框架面向 AI 研究者和开发者,特别是致力于自主代理人的人士,适合希望通过 RL 调优提升 LLM 推理‑行动链的用户。
Highlights
- Comprehensive RL Toolkit: 支持 PPO、DPO 与 GRPO,并提供基于格式和基于结果的奖励机制。
- Diverse Reasoning Strategies: 实现先进的 rollout 技术,如 MCTS 与 Depth-First Search Decision Trees (DFSDT)。
- Large-scale Trajectory Dataset: 包含超过 50,000 条使用 ReAct 框架的代理轨迹组合数据集。
- Environment Integration: 内建对 ALFWorld 与 WebShop 等代理环境的支持,可进行在线 RL 调优。