OpenManus/OpenManus-RL
A live stream development of RL tunning for LLM agents
What it solves
OpenManus-RL 提供一個框架,透過強化學習 (RL) 增強 LLM 代理人的推理與決策能力。它旨在超越簡單的監督式微調,探索 RL 如何優化代理人在複雜環境中的規劃、工具使用與錯誤恢復能力。
How it works
此專案整合 verl RL 框架以實作各種訓練範式。它結合 Supervised Fine-Tuning (SFT) 作為初始化,並使用 PPO、DPO、GRPO 等 RL 演算法來細緻化代理人行為。為了提升推理,實驗了 Tree-of-Thoughts (ToT)、Graph-of-Thoughts (GoT) 與 Monte Carlo Tree Search (MCTS) 等 rollout 策略。系統以六大領域(OS、DB、Web、KG、Household、E‑commerce)的大型結合資料集為基礎,並在 GAIA、AgentBench、WebShop 等基準上進行評估。
Who it’s for
此框架設計給 AI 研究者與開發者,特別是致力於自主代理人的人士,適合想要透過 RL 調校提升 LLM 推理‑行動鏈的使用者。
Highlights
- Comprehensive RL Toolkit: 支援 PPO、DPO 與 GRPO,並提供格式導向與結果導向的獎勵機制。
- Diverse Reasoning Strategies: 實作先進的 rollout 技術,如 MCTS 與 Depth-First Search Decision Trees (DFSDT)。
- Large-scale Trajectory Dataset: 包含超過 50,000 筆使用 ReAct 框架的代理人軌跡結合資料集。
- Environment Integration: 內建對 ALFWorld 與 WebShop 等代理環境的支援,可進行線上 RL 調校。