OpenPipe/ART
Agent Reinforcement Trainer: train multi-step agents for real-world tasks using GRPO. Give your agents on-the-job training. Reinforcement learning for Qwen3.6, GPT-OSS, Llama, and more!
解決する課題
ART (Agent Reinforcement Trainer) は、マルチステップAIエージェントの信頼性向上における困難に対処します。開発者は、大規模なDevOpsやインフラ管理を必要とせず、Group Relative Policy Optimization (GRPO) を用いた強化学習 (RL) を通じてLLMが経験から学習できるようにすることで、静的なデータセットの枠を超えた開発を可能にします。
仕組み
ARTは、機能をクライアントとサーバーに分割しています:
- Inference: OpenAI互換のクライアントがエージェントのワークフローを実行します。完了リクエストは、vLLMを介してモデルの最新のLoRAを実行しているARTサーバーにルーティングされます。各インタラクションは「Trajectory」として保存されます。
- Reward Assignment: ロールアウトが終了すると、開発者はエージェントのパフォーマンスに基づいてトラジェクトリに報酬を割り当てます。
- Training: トラジェクトリはグループ化されてサーバーに送信され、サーバーはGRPOを使用してモデルを訓練します。その後、サーバーは新しいLoRAチェックポイントを保存し、次回の推論のためにvLLMに再ロードします。
また、W&B Trainingを介した「Serverless RL」オプションも提供しており、インフラ管理を自動化し、コストを削減して訓練速度を向上させます。
対象者
強化学習を通じてモデルの推論能力やツール使用能力を向上させたいと考えているが、GPUクラスターやRL訓練ループの管理の複雑さを避けたい、マルチステップAIエージェントを構築している開発者。
ハイライト
- GRPO Integration: Group Relative Policy OptimizationをPythonアプリケーションに統合するための、使いやすいハーネスを提供します。
- Broad Model Support: ほとんどのvLLMおよびHuggingFace-transformersの因果言語モデルと互換性があります(Unsloth経由)。
- Flexible Deployment: ローカルGPUでのARTサーバーの実行、または管理されたサーバーレスバックエンドの使用をサポートしています。
- Extensible Integrations: LangGraph、MCPサーバー、およびLangfuseやOpenPipeのようなオブザーバビリティツールと連携します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト