OpenPipe/ART

Agent Reinforcement Trainer: train multi-step agents for real-world tasks using GRPO. Give your agents on-the-job training. Reinforcement learning for Qwen3.6, GPT-OSS, Llama, and more!

解決する課題

ART (Agent Reinforcement Trainer) は、マルチステップAIエージェントの信頼性向上における困難に対処します。開発者は、大規模なDevOpsやインフラ管理を必要とせず、Group Relative Policy Optimization (GRPO) を用いた強化学習 (RL) を通じてLLMが経験から学習できるようにすることで、静的なデータセットの枠を超えた開発を可能にします。

仕組み

ARTは、機能をクライアントとサーバーに分割しています:

  1. Inference: OpenAI互換のクライアントがエージェントのワークフローを実行します。完了リクエストは、vLLMを介してモデルの最新のLoRAを実行しているARTサーバーにルーティングされます。各インタラクションは「Trajectory」として保存されます。
  2. Reward Assignment: ロールアウトが終了すると、開発者はエージェントのパフォーマンスに基づいてトラジェクトリに報酬を割り当てます。
  3. Training: トラジェクトリはグループ化されてサーバーに送信され、サーバーはGRPOを使用してモデルを訓練します。その後、サーバーは新しいLoRAチェックポイントを保存し、次回の推論のためにvLLMに再ロードします。

また、W&B Trainingを介した「Serverless RL」オプションも提供しており、インフラ管理を自動化し、コストを削減して訓練速度を向上させます。

対象者

強化学習を通じてモデルの推論能力やツール使用能力を向上させたいと考えているが、GPUクラスターやRL訓練ループの管理の複雑さを避けたい、マルチステップAIエージェントを構築している開発者。

ハイライト

  • GRPO Integration: Group Relative Policy OptimizationをPythonアプリケーションに統合するための、使いやすいハーネスを提供します。
  • Broad Model Support: ほとんどのvLLMおよびHuggingFace-transformersの因果言語モデルと互換性があります(Unsloth経由)。
  • Flexible Deployment: ローカルGPUでのARTサーバーの実行、または管理されたサーバーレスバックエンドの使用をサポートしています。
  • Extensible Integrations: LangGraph、MCPサーバー、およびLangfuseやOpenPipeのようなオブザーバビリティツールと連携します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト