OpenManus/OpenManus-RL

A live stream development of RL tunning for LLM agents

What it solves

OpenManus-RL 提供一個框架,透過強化學習 (RL) 增強 LLM 代理人的推理與決策能力。它旨在超越簡單的監督式微調,探索 RL 如何優化代理人在複雜環境中的規劃、工具使用與錯誤恢復能力。

How it works

此專案整合 verl RL 框架以實作各種訓練範式。它結合 Supervised Fine-Tuning (SFT) 作為初始化,並使用 PPO、DPO、GRPO 等 RL 演算法來細緻化代理人行為。為了提升推理,實驗了 Tree-of-Thoughts (ToT)、Graph-of-Thoughts (GoT) 與 Monte Carlo Tree Search (MCTS) 等 rollout 策略。系統以六大領域(OS、DB、Web、KG、Household、E‑commerce)的大型結合資料集為基礎,並在 GAIA、AgentBench、WebShop 等基準上進行評估。

Who it’s for

此框架設計給 AI 研究者與開發者,特別是致力於自主代理人的人士,適合想要透過 RL 調校提升 LLM 推理‑行動鏈的使用者。

Highlights

  • Comprehensive RL Toolkit: 支援 PPO、DPO 與 GRPO,並提供格式導向與結果導向的獎勵機制。
  • Diverse Reasoning Strategies: 實作先進的 rollout 技術,如 MCTS 與 Depth-First Search Decision Trees (DFSDT)。
  • Large-scale Trajectory Dataset: 包含超過 50,000 筆使用 ReAct 框架的代理人軌跡結合資料集。
  • Environment Integration: 內建對 ALFWorld 與 WebShop 等代理環境的支援,可進行線上 RL 調校。