microsoft/agent-lightning
The absolute trainer to light up AI agents.
解决的问题
Agent Lightning 是一个轻量级框架,旨在使用强化学习(RL)训练 AI 代理,而无需对代理的现有代码或工作流程进行重大修改。它解决了将复杂的代理工作流(包括工具、上下文和控制流)整合到基于性能更新模型的训练循环中的困难。
如何工作
该框架采用三组件架构,弥合代理环境与训练器之间的差距:
- 训练器: 使用
verl和 vLLM 管理 RL 过程,构建训练样本并更新模型策略。 - API 网关: 作为模型请求的代理,捕获交互和轨迹,这些数据将作为训练数据使用。
- 回放控制器: 启动并管理代理,可在本地或作为 Kubernetes Job 运行,使其能够与真实世界环境交互。
适用人群
希望在特定领域(如编码、搜索、数学推理)中通过强化学习提升性能的自主代理研究人员和开发者。
主要亮点
- 最小代码变更: 通过代理使用真实工作流程训练代理,无需对代理逻辑进行任何更改。
- 轻量设计: 整个框架约由 3,500 行代码组成。
- 原生支持 Kubernetes: 支持将代理作为 Kubernetes Job 运行,实现可扩展的回放数据收集。
- 已验证成果: 仅使用 6K 训练样本,Qwen3.5-9B 编码代理在 SWE-bench Verified 上实现了 14.6 个百分点的提升。
相关
- 项目
- 项目
- 项目
- 项目
- 项目