OpenPipe/ART
Agent Reinforcement Trainer: train multi-step agents for real-world tasks using GRPO. Give your agents on-the-job training. Reinforcement learning for Qwen3.6, GPT-OSS, Llama, and more!
解決的問題
ART (Agent Reinforcement Trainer) 解決了提高多步 AI 代理可靠性的難題。它允許開發人員透過強化學習 (RL),特別是使用 Group Relative Policy Optimization (GRPO),使 LLM 能夠從經驗中學習,而無需進行大量的 DevOps 或基礎設施管理,從而超越靜態數據集。
工作原理
ART 將其功能分為用戶端和伺服器:
- Inference: 一個與 OpenAI 相容的用戶端執行代理工作流。完成請求會被路由到透過 vLLM 執行模型最新 LoRA 的 ART 伺服器。每次互動都作為「Trajectory」儲存。
- Reward Assignment: 一旦 Rollout 完成,開發人員將根據代理的表現為軌跡分配獎勵。
- Training: 軌跡被分組並發送到伺服器,伺服器使用 GRPO 訓練模型。然後伺服器儲存新的 LoRA 檢查點,並將其重新載入到 vLLM 中進行下一輪推理。
它還透過 W&B Training 提供「Serverless RL」選項來自動管理基礎設施,從而降低成本並提高訓練速度。
適用對象
構建多步 AI 代理的開發人員,他們希望透過強化學習提高模型的推理和工具使用能力,但又想避免管理 GPU 集群和 RL 訓練循環的複雜性。
亮點
- GRPO Integration: 為將 Group Relative Policy Optimization 集成到 Python 應用程式中提供了一個符合人體工程學的框架。
- Broad Model Support: 相容大多數 vLLM 和 HuggingFace-transformers 因果語言模型(透過 Unsloth)。
- Flexible Deployment: 支援在本地 GPU 上執行 ART 伺服器或使用託管的無伺服器後端。
- Extensible Integrations: 支援與 LangGraph、MCP 伺服器以及 Langfuse 和 OpenPipe 等可觀測性工具協同工作。
相關
- 專案
- 專案
- 專案
- 專案