jiangxinke/Harness-RL
Agentic RAG R1 Framework via Reinforcement Learning
解決する課題
Harness-RLは、マルチエージェントシステム(ハーネス)内で言語モデルエージェントをトレーニングする際に、実行プロセス全体を単一の長いトークンシーケンスにフラット化する必要がないようにする課題に取り組みます。具体的には、エージェントのアクションとそのアクションの引数が分離されている場合に、クレジット(勾配)を正しく帰属させる問題を解決し、複雑なマルチエージェント環境でのより効率的な強化学習を可能にします。
仕組み
このシステムは、インターフェース呼び出しとセッションプレフィックスツリーから「ブラックボックストラジェクトリ」を構築します。アクションと引数の分離を処理するために、**Conflict-Aware Policy Optimization(CAPO)**を使用します。この技術は、アクショントークンと引数トークンからの勾配をそれぞれのパラメータ部分空間にルーティングし、モデルが一般的なシーケンス更新ではなく、特定のコンポーネント(アクションまたは引数)の正確性に基づいて更新されるようにします。
対象読者
このプロジェクトは、LLMベースのエージェントの強化学習に取り組むAI研究者や開発者、特に複数の専門エージェントを調整する中央エージェントアーキテクチャを構築する人々を対象としています。
ハイライト
- アクション・引数の分離: 実行シーケンスのフラット化を不要にし、マルチエージェントインタラクションの構造を維持します。
- Conflict-Aware Policy Optimization(CAPO): パラメータ部分空間を最適化するための特殊な勾配ルーティングメカニズム。
- 柔軟なトレーニングモード: 中央エージェントのみのトレーニングと、ハーネス内の全エージェントの共同トレーニングの両方をサポートします。
- 統合インフラストラクチャ: 分散ロールアウト用の
slime、SGLangサービング、Megatronトレーニングを含みます。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト