OpenManus/OpenManus-RL

A live stream development of RL tunning for LLM agents

What it solves

OpenManus-RL は、強化学習 (RL) を利用して LLM エージェントの推論と意思決定能力を向上させるフレームワークを提供します。単純な教師ありファインチューニングを超えて、RL がエージェントの計画、ツール使用、複雑な環境でのエラー回復能力をどのように最適化できるかを探ります。

How it works

本プロジェクトは verl RL フレームワークを統合し、さまざまなトレーニングパラダイムを実装します。初期化には Supervised Fine-Tuning (SFT) を使用し、PPO、DPO、GRPO といった RL アルゴリズムでエージェントの振る舞いを洗練します。推論を改善するために、Tree-of-Thoughts (ToT)、Graph-of-Thoughts (GoT)、Monte Carlo Tree Search (MCTS) などのロールアウト戦略を実験します。システムは 6 つのドメイン(OS、DB、Web、KG、Household、E‑commerce)にまたがる大規模なエージェント軌跡データセットを基盤とし、GAIA、AgentBench、WebShop といったベンチマークで評価されます。

Who it’s for

このフレームワークは、特に RL ベースのチューニングで LLM の推論‑行動チェーンを改善したい自律エージェントに取り組む AI 研究者や開発者向けに設計されています。

Highlights

  • Comprehensive RL Toolkit: PPO、DPO、GRPO をサポートし、フォーマットベースとアウトカムベースの報酬を提供。
  • Diverse Reasoning Strategies: MCTS や Depth-First Search Decision Trees (DFSDT) など高度なロールアウト手法を実装。
  • Large-scale Trajectory Dataset: ReAct フレームワークを使用した 50,000 件以上のエージェント軌跡を含む統合データセット。
  • Environment Integration: ALFWorld や WebShop などのエージェント環境への組み込みサポートにより、オンライン RL チューニングが可能。