OpenManus/OpenManus-RL

A live stream development of RL tunning for LLM agents

What it solves

OpenManus-RL 提供一个框架,通过强化学习 (RL) 增强 LLM 代理人的推理与决策能力。它旨在超越简单的监督式微调,探索 RL 如何优化代理人在复杂环境中的规划、工具使用与错误恢复能力。

How it works

该项目整合 verl RL 框架以实现各种训练范式。它结合 Supervised Fine-Tuning (SFT) 作为初始化,并使用 PPO、DPO、GRPO 等 RL 算法来细化代理行为。为了提升推理,实验了 Tree-of-Thoughts (ToT)、Graph-of-Thoughts (GoT) 与 Monte Carlo Tree Search (MCTS) 等 rollout 策略。系统基于六大领域(OS、DB、Web、KG、Household、E‑commerce)的大型组合数据集,并在 GAIA、AgentBench、WebShop 等基准上进行评估。

Who it’s for

此框架面向 AI 研究者和开发者,特别是致力于自主代理人的人士,适合希望通过 RL 调优提升 LLM 推理‑行动链的用户。

Highlights

  • Comprehensive RL Toolkit: 支持 PPO、DPO 与 GRPO,并提供基于格式和基于结果的奖励机制。
  • Diverse Reasoning Strategies: 实现先进的 rollout 技术,如 MCTS 与 Depth-First Search Decision Trees (DFSDT)。
  • Large-scale Trajectory Dataset: 包含超过 50,000 条使用 ReAct 框架的代理轨迹组合数据集。
  • Environment Integration: 内建对 ALFWorld 与 WebShop 等代理环境的支持,可进行在线 RL 调优。