OpenPipe/ART
Agent Reinforcement Trainer: train multi-step agents for real-world tasks using GRPO. Give your agents on-the-job training. Reinforcement learning for Qwen3.6, GPT-OSS, Llama, and more!
解决的问题
ART (Agent Reinforcement Trainer) 解决了提高多步 AI 智能体可靠性的难题。它允许开发人员通过强化学习 (RL),特别是使用 Group Relative Policy Optimization (GRPO),使 LLM 能够从经验中学习,而无需进行大量的 DevOps 或基础设施管理,从而超越静态数据集。
工作原理
ART 将其功能分为客户端和服务器:
- Inference: 一个与 OpenAI 兼容的客户端执行智能体工作流。完成请求会被路由到通过 vLLM 运行模型最新 LoRA 的 ART 服务器。每次交互都作为“Trajectory”存储。
- Reward Assignment: 一旦 Rollout 完成,开发人员将根据智能体的表现为轨迹分配奖励。
- Training: 轨迹被分组并发送到服务器,服务器使用 GRPO 训练模型。然后服务器保存新的 LoRA 检查点,并将其重新加载到 vLLM 中进行下一轮推理。
它还通过 W&B Training 提供“Serverless RL”选项来自动管理基础设施,从而降低成本并提高训练速度。
适用对象
构建多步 AI 智能体的开发人员,他们希望通过强化学习提高模型的推理和工具使用能力,但又想避免管理 GPU 集群和 RL 训练循环的复杂性。
亮点
- GRPO Integration: 为将 Group Relative Policy Optimization 集成到 Python 应用程序中提供了一个符合人体工程学的框架。
- Broad Model Support: 兼容大多数 vLLM 和 HuggingFace-transformers 因果语言模型(通过 Unsloth)。
- Flexible Deployment: 支持在本地 GPU 上运行 ART 服务器或使用托管的无服务器后端。
- Extensible Integrations: 支持与 LangGraph、MCP 服务器以及 Langfuse 和 OpenPipe 等可观测性工具协同工作。
相关
- 项目
- 项目
- 项目
- 项目